OpenAI 在 2026 年 7 月 30 日調整了 GPT-5.6 API 的定價和低延遲處理方式。 這次變化包含三件事:
-
GPT-5.6 Luna 價格降低 80%;
-
GPT-5.6 Terra 價格降低 20%;
-
Priority Processing 更名為 Fast mode。 GPT-5.6 Sol 在 Fast mode 下最高可達到 Standard 處理速度的 2.5 倍,價格為 Standard 的 2 倍。 現有程式碼不需要立即改動。 請求中繼續使用
service_tier: "priority",會獲得與service_tier: "fast"相同的處理行為。 官方來源: -
Fast mode 使用文件 如果需要了解 Sol、Terra、Luna 的原始定位和釋出背景,可先閱讀:GPT-5.6 Sol 有限預覽與模型分層。
先看結論:誰最受益
Luna 是這次降價幅度最大的模型。 它的 Standard 短上下文輸入價格從每百萬 token 1 美元降到 0.20 美元,輸出從 6 美元降到 1.20 美元。 Terra 的 Standard 短上下文輸入價格從 2.50 美元降到 2 美元,輸出從 15 美元降到 12 美元。 Sol 的 Standard 短上下文價格仍為輸入 5 美元、輸出 30 美元。 它的主要變化不是 Standard 降價,而是 Fast mode 提速。 可以這樣理解三檔模型:
| 模型 | 這次主要變化 | 更適合的任務 |
|---|---|---|
| GPT-5.6 Luna | 降價 80% | 分類、抽取、清洗、輕量摘要和高吞吐任務 |
| GPT-5.6 Terra | 降價 20% | 預設對話、常規編碼、內容生成和中等複雜度 Agent |
| GPT-5.6 Sol | Fast mode 最高 2.5 倍速度 | 高價值互動、複雜編碼、難題推理和低延遲 Agent |
| 如果當前系統的大部分請求並不需要旗艦推理能力,Luna 的成本變化最值得重新評測。 如果系統預設使用 Terra,新價格會直接降低輸入和輸出成本。 如果產品使用 Sol 且使用者在等待結果,Fast mode 才是本次更新的重點。 |
GPT-5.6 Standard 最新價格
官方價格以每百萬 token 計費。 下面是短上下文 Standard 價格:
| 模型 ID | 輸入 | 快取輸入 | 快取寫入 | 輸出 |
|---|---|---|---|---|
gpt-5.6-sol |
$5.00 | $0.50 | $6.25 | $30.00 |
gpt-5.6-terra |
$2.00 | $0.20 | $2.50 | $12.00 |
gpt-5.6-luna |
$0.20 | $0.02 | $0.25 | $1.20 |
| 長上下文 Standard 價格更高: |
| 模型 ID | 輸入 | 快取輸入 | 快取寫入 | 輸出 |
|---|---|---|---|---|
gpt-5.6-sol |
$10.00 | $1.00 | $12.50 | $45.00 |
gpt-5.6-terra |
$4.00 | $0.40 | $5.00 | $18.00 |
gpt-5.6-luna |
$0.40 | $0.04 | $0.50 | $1.80 |
| 不要只看輸入價格。 生成型任務的輸出 token 可能佔據大部分賬單,尤其是程式碼生成、長報告和多輪 Agent。 成本評估至少要記錄: |
- 未快取輸入 token;
- 快取輸入 token;
- 快取寫入 token;
- 輸出 token;
- Standard 與 Fast mode 的請求比例;
- 短上下文與長上下文請求比例。
Luna 降價 80% 後意味著什麼
Luna 的輸入和輸出價格都變為原來的 20%。 舊的短上下文 Standard 價格是:
-
輸入:$1.00 / 1M token;
-
輸出:$6.00 / 1M token。 新的價格是:
-
輸入:$0.20 / 1M token;
-
輸出:$1.20 / 1M token。 假設一個批處理任務每月使用 1 億輸入 token 和 2,000 萬輸出 token: 舊價格估算:
|
|
新價格估算:
|
|
在 token 用量不變的情況下,這個示例的費用從 220 美元降到 44 美元。 但價格下降不代表所有任務都應該遷移到 Luna。 先用真實請求檢查指令遵循、結構化輸出、工具呼叫和錯誤率。 如果模型變便宜,卻導致重試次數或人工修正增加,總成本未必真的下降。
Terra 降價 20% 後如何計算
Terra 的舊短上下文 Standard 價格是:
-
輸入:$2.50 / 1M token;
-
輸出:$15.00 / 1M token。 新價格是:
-
輸入:$2.00 / 1M token;
-
輸出:$12.00 / 1M token。 假設每月使用 1 億輸入 token 和 2,000 萬輸出 token: 舊價格估算:
|
|
新價格估算:
|
|
示例每月可減少 110 美元,降幅正好是 20%。 Terra 更適合已經把它作為預設生產模型的團隊。 不需要改模型 ID,賬單會按新價格計算。
Fast mode 是什麼
Fast mode 是原 Priority Processing 的新名稱。 它仍然是按量付費的低延遲處理方式,但官方把產品定位和引數名稱變得更直觀。 Fast mode 的目標是:
- 降低響應等待時間;
- 提供更穩定的延遲;
- 保留按量付費方式;
- 服務有穩定流量的高價值使用者請求。
對
gpt-5.6-sol,Fast mode 最高可達到 Standard 的 2.5 倍速度。 “最高 2.5 倍”不是每個請求都固定提升 2.5 倍。 實際延遲仍與輸入長度、輸出長度、工具呼叫、網路和系統負載有關。
Fast mode 最新價格
當前短上下文 Fast mode 價格如下:
| 模型 ID | 輸入 | 快取輸入 | 快取寫入 | 輸出 |
|---|---|---|---|---|
gpt-5.6-sol |
$10.00 | $1.00 | $12.50 | $60.00 |
gpt-5.6-terra |
$4.00 | $0.40 | $5.00 | $24.00 |
gpt-5.6-luna |
$0.40 | $0.04 | $0.50 | $2.40 |
| Fast mode 的每項 token 價格都是對應 Standard 短上下文價格的 2 倍。 以 Sol 為例,如果一次業務週期使用 1,000 萬輸入 token 和 200 萬輸出 token: Standard: |
|
|
Fast mode:
|
|
是否值得多付 110 美元,要看延遲下降能否改善轉化率、任務完成率或人工效率。
單個請求啟用 Fast mode
Responses API 使用 service_tier: "fast":
|
|
Python SDK 示例:
|
|
Fast mode 同時可用於 Responses API 和 Chat Completions API。
舊的 priority 引數需要修改嗎
不需要立即修改。 下面的舊請求仍然有效:
|
|
對於受支援模型,priority 與 fast 會獲得相同的處理行為。 建議新程式碼使用 fast,因為名稱與當前文件一致。 舊程式碼可以按正常釋出週期逐步遷移,不必緊急全量替換。 需要特別注意響應物件。 對 GPT-5.6 及更早模型,即使請求寫的是 fast,響應裡的 service_tier 仍可能返回 priority。 因此,監控系統不要把返回 priority 直接判斷為配置沒有生效。
在專案級別預設啟用 Fast mode
如果專案中的大部分使用者請求都需要低延遲,可以在專案設定中啟用:
- 開啟 OpenAI API Platform 的專案設定;
- 進入
General; - 找到
Project Service Tier; - 選擇
Fast。 設定後,沒有顯式傳入service_tier的請求會逐步轉向 Fast mode。 官方說明專案請求會隨時間漸進切換。 不要把設定儲存後的第一分鐘資料當作最終結果。 更穩妥的方式是先按請求啟用,用功能開關控制少量流量,再決定是否改專案預設值。
速率限制並不會翻倍
Fast mode 和 Standard 處理共享同一個模型速率限制。 啟用 Fast mode 不會自動增加 TPM 或 RPM 配額。 原有的重試、退避和併發控制仍然需要保留。 如果系統因為更快返回而立即發出更多後續請求,反而可能更快觸發速率限制。 驗證時應同時觀察:
- 請求延遲;
429響應;- 每分鐘 token;
- 併發任務數;
- 重試次數;
- 實際完成時間。
突發流量可能被降級到 Standard
Fast mode 有 ramp rate limit。 當流量至少達到每分鐘 100 萬 token,並且 15 分鐘內 TPM 增長超過 50% 時,部分 Fast mode 請求可能被降級。 降級後:
-
請求按 Standard 速度處理;
-
費用按 Standard 價格計算;
-
響應中的
service_tier為default。 降低觸發風險的方法包括: -
切換模型或快照時逐步放量;
-
使用功能開關在數小時內遷移流量;
-
避免把大型 ETL 或批處理任務放進 Fast mode;
-
保留 Standard 降級路徑;
-
按服務層級統計延遲和費用。
哪些場景不適合 Fast mode
Fast mode 適合延遲直接影響使用者體驗的請求,例如:
-
實時編碼助手;
-
互動式 Agent;
-
使用者正在等待的複雜分析;
-
高價值客服或銷售流程;
-
對首字延遲和總耗時敏感的產品。 不適合的場景包括:
-
離線批處理;
-
夜間資料清洗;
-
對完成時間不敏感的佇列;
-
可以使用 Batch 或 Flex 的任務;
-
大規模 ETL;
-
只為跑分而開啟的全量流量。 如果使用者不會感知幾十秒的差異,支付 2 倍 token 價格通常沒有必要。
Fast mode 當前功能限制
官方文件列出的限制包括:
- 不支援長上下文;
- 不支援微調模型;
- 不支援 Embeddings;
- 地區可用性取決於當地法律和監管;
- 不保證未來每個 GPT 模型都支援;
- Scale Tier 與 Fast mode 分開計費。 Fast mode 支援 Standard 模式已有的多模態能力,包括影象輸入。 快取輸入仍然可以享受折扣。 Fast mode 相容資料駐留、Zero Data Retention 和 BAA,但原有端點、工具、資格和合同要求仍然適用。
如何驗證 Fast mode 是否真的更快
不要只執行一次請求就下結論。 準備一組真實業務樣本,分別用 Standard 和 Fast mode 執行。 至少記錄:
| 指標 | 目的 |
|---|---|
| 首字延遲 | 判斷使用者多久看到第一個輸出 |
| 完整響應時間 | 判斷任務總等待時間 |
| P50、P95、P99 | 避免平均值掩蓋長尾延遲 |
| 輸入與輸出 token | 確認兩組請求工作量相近 |
service_tier |
識別 Fast、相容 priority 或降級 default |
| 錯誤和重試 | 排除限流造成的假性變慢 |
| 每次成功任務成本 | 判斷速度收益是否值得溢價 |
| 同一個提示至少重複多次,並儘量在相近流量條件下比較。 Agent 工作流還要記錄工具呼叫等待時間。 如果瓶頸在資料庫、瀏覽器或第三方 API,模型加速並不會讓整個任務快 2.5 倍。 |
一套安全的遷移步驟
生產環境可以按以下順序遷移:
- 保留當前 Standard 基線資料;
- 選擇最依賴低延遲的一個介面;
- 給 1% 流量設定
service_tier: "fast"; - 比較 P50、P95、成功率和單位任務成本;
- 檢查響應中的
priority與default; - 逐步擴大到 5%、10% 和 25%;
- 觀察是否觸發 ramp rate limit;
- 確認業務指標改善後再繼續放量;
- 不需要低延遲的任務繼續使用 Standard、Batch 或 Flex;
- 最後再考慮專案級預設啟用。 不要只按模型名稱統一切換整個組織。 同一個專案中的介面對延遲和成本可能有完全不同的敏感度。
如何在 Luna、Terra、Sol 之間重新分流
降價後可以重新設計任務路由:
- Luna:高吞吐、規則明確、可自動驗收的輕量任務;
- Terra:預設生產流量和中等複雜度任務;
- Sol:複雜推理、困難編碼和高價值失敗重試;
- Sol Fast mode:使用者正在等待且延遲會影響業務結果的複雜請求。 先由 Luna 或 Terra 處理,再把失敗或低置信度請求升級到 Sol,通常比所有請求直接進入 Sol 更省錢。 Fast mode 應該是延遲路由,而不是能力路由。 它不會把 Luna 變成 Sol,也不會自動提高模型答案質量。
常見問題
Luna 和 Terra 的模型 ID 變了嗎
沒有。 仍然使用 gpt-5.6-luna 和 gpt-5.6-terra,價格從 2026 年 7 月 30 日起調整。
Sol 的 Standard 價格下降了嗎
官方本次更新重點是 Luna、Terra 降價,以及 Sol 的 Fast mode 提速。 Sol Standard 短上下文價格仍是輸入 5 美元、輸出 30 美元。
priority 會被廢棄嗎
當前官方文件明確說明 priority 和 fast 都可使用。 新程式碼建議使用 fast,舊程式碼可以逐步遷移。
為什麼請求寫 fast,響應卻返回 priority
這是 GPT-5.6 及更早模型的當前相容行為。 不要僅憑響應名稱判斷請求未進入 Fast mode。
Fast mode 一定快 2.5 倍嗎
不是。 官方表述是最高 2.5 倍,具體請求會受長度、負載、工具呼叫和網路影響。
Fast mode 會增加速率限制嗎
不會。 Fast mode 與 Standard 共享模型速率限制。
突發流量降級後怎麼收費
降級請求會按 Standard 速度和 Standard 價格處理,響應的 service_tier 會顯示 default。
快取輸入還能享受折扣嗎
可以。 Fast mode 仍適用符合條件的快取輸入折扣。
總結
GPT-5.6 的這次調整同時改變了成本和延遲策略。 Luna 降價 80%,讓高吞吐輕量任務的成本明顯下降。 Terra 降價 20%,直接降低預設生產流量的費用。 Sol Standard 價格不變,但 Fast mode 提供最高 2.5 倍速度,代價是 2 倍 token 價格。 舊的 service_tier: "priority" 仍然相容,不需要緊急修改所有程式碼。 新接入建議使用 service_tier: "fast",並按介面逐步放量。 真正需要驗證的不是“速度是否更快”,而是更快的響應能否改善業務結果。 如果延遲收益無法覆蓋價格溢價,繼續使用 Standard、Batch 或 Flex 會更合理。