約2分

同じ長い指示を毎回送るならプロンプトキャッシュで費用を下げる

プロンプトキャッシュは、毎回同じプロンプト部分の再計算を省くことで、コストと待ち時間を下げる仕組みです。

毎回同じ書類を最初から読み直すのではなく、前回読んだところのメモを手元に置いておき、変わった部分だけを確かめる。プロンプトキャッシュは、AI への入力のうち毎回変わらない部分の処理結果をとっておき、次のリクエストで使い回す仕組みです。同じ内容を何度も計算し直さずに済むので、費用と待ち時間(レイテンシ)を下げられます。

たとえば、こんな使い方をしているときに効果が出ます。

  • 長いシステムプロンプトを、毎回同じ内容で送っている
  • 社内規定や仕様書のような大きな参照文書を、毎回添えて質問している
  • 同じ文書に対して、何度も質問を繰り返す一括処理をしている
  • チャットボットで、決まった背景情報をすべての会話に含めている

キャッシュを使わなければ、リクエストのたびに入力の全体を計算することになる。キャッシュが効いた部分は計算を省けるので、処理するトークンの費用と、最初の返事が出るまでの時間が下がります。変わらない部分が長いほど、効果は大きくなります。反対に、毎回変わる部分は、これまでどおり計算されます。

使えるかどうか、どこまで効くか、どれくらいの間保持されるかは、モデルや API しだい。キャッシュには有効期限があり、リクエストの間隔が空きすぎると、また最初から計算し直すことになります。費用の削減を見込むなら、実際のリクエストの送り方で試算してから設計しましょう。

また、これは費用と速さのための仕組みで、答えの質を上げるものではありません。出力をよくしたいなら、プロンプトの中身や設計のほうを見直します。