2026年7月30日、OpenAIはGPT-5.6 APIの価格設定と低遅延処理を調整しました。この変更には3つの内容が含まれます。
-
GPT-5.6 Luna価格は80%下落;
-
GPT-5.6 Terraの価格は20%減少;
-
Priority ProcessingをFast modeに改名。 GPT-5.6 SolはFastモードでStandardの最大2.5倍の処理速度に達し、Standardの2倍のコストがかかります。既存のコードをすぐに変更する必要はありません。リクエストで
service_tier: "priority"を使い続けると、service_tier: "fast"と同じ処理動作が発生します。公式情報源: -
Fast modeユーザードキュメント Sol、Terra、Luna の位置付けとリリース背景を確認するには、まず GPT-5.6 Sol Limited Preview and Model Layering を参照してください。
まず結論を見よう:誰が最も恩恵を受けるか
今回はLunaが最大の価格下落モデルです。標準のショートコンテキスト入力価格は100万トークンあたり1ドルから0.20ドルに、出力は6ドルから1.20ドルに下がりました。Terraの標準ショートコンテキスト入力価格は$2.50から$2に、出力は$15から$12に下がりました。SolのStandardショートコンテキスト価格は、入力5ドル、出力$30のままです。主な変更点は標準の値下げではなく、Fast modeの加速です。三層モデルの理解は次の通りです:
| モデル | 今回の主な変更点 | より適した任務 |
|---|---|---|
| GPT-5.6 Luna | 80%オフ | ソート、抽出、クリーニング、軽量な要約、そしてハイスループットタスク |
| GPT-5.6 Terra | 20%オフ | デフォルトのダイアログ、通常のエンコード、コンテンツ生成、中程度の複雑度エージェント |
| GPT-5.6Sol | Fast modeで最大2.5倍の速度 | 高価値の相互作用、複雑なコーディング、問題推論、低遅延エージェント |
| 現行システムのほとんどのリクエストがフラッグシップ推論能力を必要としない場合、Lunaのコスト変更が最も再評価に値します。システムがデフォルトでTerraに切り替えた場合、新しい価格は直接投入コストと出力コストを削減します。製品がSolを使用し、ユーザーが結果を待っている場合、このアップデートではFast modeが焦点となります。 |
GPT-5.6 Standard の最新価格
公式価格は100万トークンごとに課されます。以下は簡潔なStandard価格です:
| モデルID | 入力 | キャッシュ入力 | キャッシュ書き込み | 出力 |
|---|---|---|---|---|
gpt-5.6-sol |
$5.00 | $0.50 | $6.25 | $30.00 |
gpt-5.6-terra |
$2.00 | $0.20 | $2.50 | $12.00 |
gpt-5.6-luna |
$0.20 | $0.02 | $0.25 | $1.20 |
| 長い文脈 Standardは価格が高い: |
| モデルID | 入力 | キャッシュ入力 | キャッシュ書き込み | 出力 |
|---|---|---|---|---|
gpt-5.6-sol |
$10.00 | $1.00 | $12.50 | $45.00 |
gpt-5.6-terra |
$4.00 | $0.40 | $5.00 | $18.00 |
gpt-5.6-luna |
$0.40 | $0.04 | $0.50 | $1.80 |
| 入力価格だけを見ないでください。生成タスクの出力トークンは請求の大部分を占めるかもしれません。特にコード生成、長いレポート、複数ターンのエージェントなどです。コスト評価は少なくとも以下を記録すべきです: |
- キャッシュされていないトークン入力;
- キャッシュ入力トークン;
- キャッシュはトークンを書き込みます。
- 出力トークン;
- StandardとFast modeのリクエスト比率;
- 短いコンテキストと長いコンテキストリクエストの比率。
Lunaの80%の値下げの後、それはどういう意味なんだ?
Lunaの投入価格と出力価格は元の価値の20%に減っています。旧来の短文脈標準価格は以下の通りです。
-
入力:$1.00 / 1Mトークン;
-
出力:$6.00 / 1Mトークン。 新しい価格は以下の通りです:
-
入力:$0.20 / 1Mトークン;
-
出力:$1.20 / 1Mトークン。 バッチタスクが毎月1億の入力トークンと2000万の出力トークンを使用するとします:古い価格推定:
|
|
新しい価格見積もり:
|
|
トークン使用が変わらなければ、この例の手数料は220ドルから44ドルに下がります。しかし価格の下落がすべてのタスクをLunaに移行すべきとは限りません。まず、コマンドの遵守、構造化出力、ツール呼び出し、実際のリクエストに対するエラー率をチェックします。モデルが安くなるものの再試行や手動修正が増えても、総コストは実際には減少しないかもしれません。
Terraの20%割引後の計算方法
Terraの古い短期コンテキスト標準価格は以下の通りです:
-
入力:$2.50 / 1Mトークン;
-
出力:$15.00 / 1Mトークン。 新しい価格は以下の通りです:
-
入力:$2.00 / 1Mトークン;
-
出力:$12.00 / 1Mトークン。 毎月1億の入力トークンと2000万の出力トークンが使用されていると仮定すると:旧価格推定:
|
|
新しい価格見積もり:
|
|
例えば、月額110ドルを削減でき、これはちょうど20%の削減にあたります。Terraはすでにデフォルトの生産モデルとして使っているチームにより適しています。モデルIDを変更する必要はなく、請求書は新しい価格で計算されます。
Fast modeとは何でしょうか?
Fast modeは、元のPriority Processingの新しい名称です。これは引き続き従量課金制で低遅延の処理方式ですが、公式な製品の位置付けやパラメータはより直感的になっています。Fast modeの目標は以下の通りです:
- 応答待ち時間の短縮;
- より安定したレイテンシを提供します。
- 従量課金方式の維持;
- サービスは高価値のユーザーリクエストを持ち、安定したトラフィックを持っています。
gpt-5.6-solの場合、FastモードはStandardの最大2.5倍の速度に達することができます。「最大2.5倍」はすべてのリクエストが2.5倍に固定されているという意味ではありません。実際のレイテンシは入力長、出力長、ツール呼び出し、ネットワーク、システム負荷に依存します。
最新のFast mode価格
現在のショートコンテキストFastモードの価格は以下の通りです:
| モデルID | 入力 | キャッシュ入力 | キャッシュ書き込み | 出力 |
|---|---|---|---|---|
gpt-5.6-sol |
$10.00 | $1.00 | $12.50 | $60.00 |
gpt-5.6-terra |
$4.00 | $0.40 | $5.00 | $24.00 |
gpt-5.6-luna |
$0.40 | $0.04 | $0.50 | $2.40 |
| Fast modeでの各トークン価格は、標準のショートコンテキスト価格の2倍です。例えばSolを例にすると、景気循環が1,000万の入力トークンと200万の出力トークンを使用した場合、標準的: |
|
|
Fast mode:
|
|
追加で110ドル支払う価値があるかどうかは、遅延削減がコンバージョン率、タスク完了率、労働効率の向上につながるかどうかによります。
単一のリクエストに対してFastモードを有効にする
回答APIの使用状況service_tier: "fast":
|
|
Python SDKの例:
|
|
Fast modeはレスポンスAPIとチャットコンプリートAPIの両方に使用できます。
古い優先度パラメータを変更する必要がありますか?
即時の修正は不要です。以下の古いリクエストは現在も有効です:
|
|
対応モデルでは、priorityとfastは同じ処理動作を示します。新しいコードには、名前が現在のドキュメントと一致するため、fastを使用することが推奨されます。古いコードは通常のリリースサイクルに従って段階的に移行でき、すべてを急いで置き換える必要はありません。特にレスポンスオブジェクトに注意を払う必要があります。GPT-5.6以前のモデルでは、リクエストがfastのように書かれていても、レスポンスのservice_tierがpriorityを返すことがあります。したがって、モニタリングシステムはリターンpriorityを構成が無効であるかのように直接判断すべきではありません。
プロジェクトレベルではFast modeがデフォルトで有効です
プロジェクト内のほとんどのユーザーリクエストが低遅延を必要とする場合は、プロジェクト設定で以下の機能を有効にすることができます:
- OpenAI API Platformでプロジェクト設定を開きます。
Generalの登場;Project Service Tierを見つける;Fastを選ぶ。 設定後、明示的なservice_tierのないリクエストは徐々にFast modeに切り替わります。公式の説明では、プロジェクトのリクエストは時間とともに徐々に切り替わっていくとされています。保存されたデータの最初の1分を最終結果とみなさないでください。より安全な方法は、リクエスト通りに有効にし、関数スイッチを使って少量のトラフィックを制御し、その後プロジェクトのデフォルト値を変更するかどうかを決めることです。
レート制限は倍増しません
Fast ModeとStandardは同じモデルのレート制限を扱います。Fastモードを有効にしても、TPMやRPMの割り当てが自動的に増加するわけではありません。既存のリトライ、バックオフ、並行処理制御は引き続き維持する必要があります。もしシステムが速い返還のためにすぐにフォローアップリクエストを送ると、レート制限がより早く発動する可能性があります。検証時には以下の点に注意してください:
- リクエスト遅延;
429対応;- 1分あたりのトークン数;
- 同時進行タスクの数;
- 再挑戦回数;
- 実際の完成時間。
急増トラフィックは標準に格下げされる場合があります
Fast modeにはランプレートの制限があります。トラフィックが1分間に100万トークン以上に達し、15分以内にTPMが50%以上増加した場合、一部のFast modeリクエストはダウングレードされることがあります。ダウングレード後:
-
標準速度で処理されるリクエスト;
-
料金は標準料金で計算されます。
-
回答の
service_tierはdefaultです。 トリガーリスクを減らす方法には以下が含まれます: -
モデルやスナップショットを切り替える際の段階的な拡大;
-
機能スイッチを使って数時間以内にトラフィックを移行すること;
-
大規模なETLやバッチタスクをFast modeに切り替えることを避けること;
-
標準ダウングレード経路を維持;
-
サービスレベルごとの遅延と料金に関する統計。
どのシナリオがFast modeに適さないのか?
Fast modeは、遅延がユーザー体験に直接影響を与えるリクエストに適しています。例えば:
-
リアルタイムコーディングアシスタント;
-
インタラクティブエージェント;
-
ユーザーが待つ複素解析;
-
高価値のカスタマーサービスまたは営業プロセス;
-
初期ワードレイテンシおよび総時間消費に敏感な製品。 不適切なシナリオには以下が含まれます:
-
オフラインバッチ処理;
-
夜間データクレンジング;
-
完了時間に無神経なキュー;
-
バッチまたはフレックスを使用できるタスク;
-
大規模ETL;
-
ベンチマーク専用のフルトラフィック有効。 ユーザーが数十秒の違いに気づかないなら、トークン価格の2倍を支払う必要はほとんどありません。
Fastモードの現在の制限
公式文書に記載されている制限事項は以下の通りです:
- 長いコンテキストをサポートしません。
- ファインチューニングモデルのサポートなし;
- 埋め込みはサポートされていません;
- 地域ごとの利用可能性は現地の法律や規制によって異なります。
- 将来的にすべてのGPTモデルがサポートされる保証はありません;
- スケールティアとFast modeは別々に請求されます。 Fast modeは、画像入力を含むStandardで既に利用可能なマルチモーダル機能をサポートします。キャッシュ入力は依然として除外可能です。Fast modeはデータレジデンシー、ゼロデータ保持、BAAと互換性がありますが、元のエンドポイント、ツール、適格性、契約要件は依然として適用されます。
Fastモードが本当に速いかどうかの確認方法
一度の依頼で早合点しないでください。実際のビジネスサンプルを用意し、StandardとFast modeで別々に実行してください。最低限:
| 指標 | 目的 |
|---|---|
| 初期遅延 | ユーザーが最初の出力を見るまでの時間を決定します |
| フル応答時間 | タスクの総待ち時間を決定する |
| P50、P95、P99 | 平均的なマスクのロングテール遅延を避けましょう |
| 入力トークンと出力トークン | 2つの要求グループのワークロードが似ていることを確認しましょう |
service_tier |
高速で互換性のある優先度を特定、またはデフォルトをダウングレードする |
| エラーと再試行 | レート制限による疑似遅延を除き |
| タスク成功ごとのコスト | 速度の向上がプレミアムに見合うかどうかを判断する |
| 同じプロンプトを少なくとも数回繰り返し、似た交通状況で比較してみてください。エージェントのワークフローはツール呼び出し待ち時間も記録します。ボトルネックがデータベース、ブラウザ、またはサードパーティAPIにある場合、モデルアクセラレーションだけでは全体の作業が2.5倍速くなるわけではありません。 |
安全な移行ステップのセット
本番環境は以下の順序で移行できます:
- 現在の標準基準データを保持すること;
- 低遅延に最も依存するインターフェースを選択する;
service_tier: "fast"をトラフィックの1%に設定;- P50、P95、成功率、単位作業コストを比較する。
- 回答の
priorityとdefaultを確認する; - 徐々に5%、10%、25%へ拡大;
- ランプレートリミットが発動するかどうかを観察する。
- 事業指標の改善を確認してから、さらなるボリューム増加を進める;
- 低遅延を必要としないタスクは、Standard、バッチ、またはフレックスを継続できます。
- 最後に、プロジェクトレベルのデフォルト設定を有効にすることを検討してください。 組織全体でモデル名で均一に切り替えるのはやめましょう。同じプロジェクト内のインターフェースは、レイテンシやコストに対する感受度が全く異なる場合があります。
Luna、Terra、Solの間で再分割する方法
価格が下がった後は、タスクルートを再設計できます:
- Luna:軽量でスループットが高く、ルールは明確で、自動受理;
- Terra:デフォルトの本番トラフィックおよび中程度の複雑度タスク;
- SOL:複雑な推論、難しいコーディング、高価値の失敗した再試行;
- SolFast mode:ユーザーが待機し遅延がビジネス成果に影響を与える複雑なリクエスト。 まずLunaやTerraが処理し、その後、失敗や低信頼度のリクエストをSolにアップグレードします。これは通常、Solに直接送るすべてのリクエストよりもコスト効率が良いです。Fast modeは遅延ルーティングであり、能力ルーティングではありません。LunaをSolに変えるわけでも、モデル回答の品質を自動的に向上させるわけでもありません。
よくある質問
LunaとTerraのモデルIDは変わった?
いいえ。gpt-5.6-lunaとgpt-5.6-terraはまだ使用されており、2026年7月30日から価格が調整されます。
Solの標準価格は下がったのか?
このアップデートの公式な焦点は、LunaとTerraの価格引き下げ、そしてSolのFast modeの高速化にあります。SolStandardの短期コンテキスト価格は入力で5ドル、出力が30ドルのままです。
priority は廃止されますか?
現在の公式ドキュメントでは、priorityとfastの両方が使用可能であることが明確に記載されています。新しいコードにはfastを使うことが推奨され、古いコードは段階的に移行可能です。
fast を指定してもレスポンスが priority になるのはなぜですか?
これはGPT-5.6以前のモデルの現在の互換性挙動です。レスポンス名だけでリクエストがFast modeに入っていないと判断しないでください。
Fastモードはいつも2.5倍速いの?
いいえ。公式の説明は最大2.5倍で、特定のリクエストは長さ、負荷、ユーティリティ通話、ネットワークによって影響されます。
Fastモードはレート制限を追加しますか?
いいえ。Fast modeはStandardとモデルのレート制限を共有しています。
急増トラフィック問題をダウングレードした後、どうやって課金すればいいですか?
ダウングレードのリクエストは標準速度と標準価格で処理され、応答service_tierにはdefaultが表示されます。
キャッシュで入るときに割引は受けられますか?
はい。Fast modeでもキャッシュ入力割引は適用されます。
まとめ
GPT-5.6のこの調整はコストとレイテンシ戦略を同時に変化させます。Lunaは80%削減され、高スループットで軽量なタスクのコストが大幅に低下しました。Terraは20%削減し、デフォルトの生産トラフィックコストを直接下げました。Sol Standardは価格変更が変わりませんが、Fast Modeは最大2.5倍の速度を提供し、その代償としてトークン価格が2倍になります。旧版service_tier: "priority"互換性を維持し、すべてのコードを急いで変更する必要はありません。New Accessはservice_tier: "fast"を使い、インターフェースごとに徐々にスケールアップすることを推奨します。本当に検証が必要なのは「高速化」ではなく、より迅速な対応がビジネス成果を向上させるかどうかです。遅延の増加が価格プレミアムを相殺できない場合は、Standard、Batch、Flexを継続する方が合理的です。