OpenAI APIのプロンプトキャッシュは、同じプロンプト前半を何度も使う業務で入力コストと初動遅延を下げる仕組みです。2026年9月時点の公式ドキュメントでは、対応モデルで標準有効、cached inputは最大90%割引、GPT-5.6以降では明示breakpointと30分TTLを設計できます。
結論は、キャッシュは魔法の値引きではなく「再利用される前半を固定する運用」です。RAG、社内FAQ、AIエージェント、長い開発ルールを使う企業ほど、何を固定し、どこから可変にするかを先に決める必要があります。
OpenAIプロンプトキャッシュとは?まず押さえる定義
プロンプトキャッシュとは、モデルが入力を処理するときに作る中間状態を、同じprefix、つまりプロンプト先頭から一致する部分に対して再利用する仕組みです。OpenAIの説明では、保存されるのはトークン本文そのものではなくKV stateです。
メリットは3つあります。入力トークンの費用低下、応答開始までの短縮、長い共通コンテキストを使うワークフローの安定化です。社内規程、ツール定義、RAGの共通説明、コーディング規約を毎回渡す構成では効果が出やすくなります。
90%削減が効く条件:固定prefixを崩さない
OpenAIの料金表では、GPT-6 Solの短文脈入力が100万tokensあたり2.00ドル、cached inputが0.20ドルです。GPT-6 Lunaも0.10ドルに対して0.01ドルで、cached inputは通常入力の10分の1です。ただし、同じprefixが再利用できた場合に限ります。
設計では、先頭に「恒久ルール」「ツール定義」「出力形式」「社内共通知識」を置き、その後ろにユーザーごとの差分や検索結果を置きます。時刻、検索結果、顧客固有情報を前方に混ぜると、cache hit率は落ちます。
GPT-5.6以降の3つの設計ポイント
GPT-5.6以降では、最低1,024 visible input tokens以上のprefixがキャッシュ対象です。cache writeは標準入力単価の1.25倍、cache readは0.1倍です。1回書いて1回読むだけでも通常入力を2回処理するより安くなります。
ポイントは3つです。implicit modeで自動breakpointに任せるか、explicit modeで開発者がbreakpointを指定するかを選ぶ。1リクエスト最大4つのcache writeを意識する。TTLは30分が基本なので、短時間で再利用される処理から優先する。この順で考えると判断しやすくなります。
管理者が見るべき比較:implicitとexplicit
implicitは導入が簡単で、多くの通常ワークフローではまず十分です。explicitは「社内ルール部分だけを書き込み、後ろの検索結果は書き込まない」といった制御に向きます。長いツール定義を持つエージェントや、顧客別の原価を説明したいSaaSでは検討価値があります。
早期導入では、1つの処理をimplicitで1週間測り、Prompt Caching Dashboardのcache read hit rateを確認します。missが多い処理だけexplicit breakpointやprompt_cache_keyを検討します。GPT-5.6以降のprompt_cache_keyは、主に顧客別・ユーザー別の会計分離に使う整理で十分です。
30日PoCチェックリスト
1週目: 料金上位のAPI呼び出しを抽出し、1,024 tokensを超える共通prefixがある処理を3つ選びます。RAG、社内FAQ、コードレビュー、契約書レビューが候補です。
2週目: 共通prefixを先頭に固定し、ユーザー入力、検索結果、日付、顧客固有情報を後方へ移動します。ツール定義やJSON schemaの順序も固定します。
3週目: cache read hit rate、cached_tokens、入力単価、初回tokenまでの時間を記録します。15 requests per minuteを超える高頻度キーではroutingが分散しやすいため、顧客やワークロード単位で分割します。
4週目: 10回以上再利用されるprefixだけを標準化します。Zero Data Retention、data residency、顧客別説明の要件がある場合は、キャッシュ保持と地域境界の扱いを手順に明記します。
自社APIのキャッシュ設計、RAG構成、コスト可視化をまとめて見直したい場合は、 HelloCraftAIにご相談ください 。既存のプロンプト構造を見ながら、費用削減と監査説明の両方を設計します。
失敗しやすいパターン
失敗例の多くは、キャッシュが効かない構造をアプリ側で作っているケースです。毎回異なるタイムスタンプをdeveloper messageの先頭に入れる、検索結果を固定ルールより前に置く、ツールschemaの順序が変わる、といった設計は避けます。
cacheは組織やregional processing boundaryをまたいで共有されません。別組織、別リージョン、別モデルでは同じ文章でも同じcacheとして扱えない前提で設計します。
FAQ
Q. 手動で有効化が必要ですか? A. 対応モデルでは標準で有効です。ただしGPT-5.6以降で明示breakpointを使う場合は、prompt_cache_optionsやcontent block側の指定を設計します。
Q. どんな業務で効果が出ますか? A. 同じ長い前提を何度も使う業務です。社内ナレッジRAG、AIエージェントのツール定義、コードレビュー規約、契約書レビュー基準などが代表例です。
Q. まず何を測ればよいですか? A. cache read hit rate、cached_tokens、通常入力とcached inputの比率、応答開始までの時間です。費用だけを見ると、routing分散に気づきにくくなります。
まとめ:キャッシュはコスト機能ではなく設計機能
OpenAIプロンプトキャッシュの価値は、最大90%のcached input割引だけではありません。固定prefixを標準化することで、社内AIアプリの説明責任、RAGの再現性、エージェント運用の原価管理まで整えられます。まずは料金上位の3ワークフローを選び、30日でprefix固定、hit rate測定、顧客別会計の3点を確認するのが現実的です。
HelloCraftAIでは、生成AI導入企業向けにAPI設計、プロンプト標準化、コスト管理、社内研修まで一体で支援しています。OpenAI APIの運用設計を見直したい方は お問い合わせください 。