GPT-5.6 API 降價與 Fast mode 指南:Luna、Terra、Sol 新價格

解析 GPT-5.6 Luna 與 Terra 降價、Sol Fast mode 的速度和價格,並給出 service_tier 配置、相容遷移、成本估算及限流排查方法。

OpenAI 在 2026 年 7 月 30 日調整了 GPT-5.6 API 的定價和低延遲處理方式。 這次變化包含三件事:

  • GPT-5.6 Luna 價格降低 80%;

  • GPT-5.6 Terra 價格降低 20%;

  • Priority Processing 更名為 Fast mode。 GPT-5.6 Sol 在 Fast mode 下最高可達到 Standard 處理速度的 2.5 倍,價格為 Standard 的 2 倍。 現有程式碼不需要立即改動。 請求中繼續使用 service_tier: "priority",會獲得與 service_tier: "fast" 相同的處理行為。 官方來源:

  • OpenAI 產品更新說明

  • OpenAI API 最新價格

  • Fast mode 使用文件 如果需要了解 Sol、Terra、Luna 的原始定位和釋出背景,可先閱讀:GPT-5.6 Sol 有限預覽與模型分層

先看結論:誰最受益

Luna 是這次降價幅度最大的模型。 它的 Standard 短上下文輸入價格從每百萬 token 1 美元降到 0.20 美元,輸出從 6 美元降到 1.20 美元。 Terra 的 Standard 短上下文輸入價格從 2.50 美元降到 2 美元,輸出從 15 美元降到 12 美元。 Sol 的 Standard 短上下文價格仍為輸入 5 美元、輸出 30 美元。 它的主要變化不是 Standard 降價,而是 Fast mode 提速。 可以這樣理解三檔模型:

模型 這次主要變化 更適合的任務
GPT-5.6 Luna 降價 80% 分類、抽取、清洗、輕量摘要和高吞吐任務
GPT-5.6 Terra 降價 20% 預設對話、常規編碼、內容生成和中等複雜度 Agent
GPT-5.6 Sol Fast mode 最高 2.5 倍速度 高價值互動、複雜編碼、難題推理和低延遲 Agent
如果當前系統的大部分請求並不需要旗艦推理能力,Luna 的成本變化最值得重新評測。 如果系統預設使用 Terra,新價格會直接降低輸入和輸出成本。 如果產品使用 Sol 且使用者在等待結果,Fast mode 才是本次更新的重點。

GPT-5.6 Standard 最新價格

官方價格以每百萬 token 計費。 下面是短上下文 Standard 價格:

模型 ID 輸入 快取輸入 快取寫入 輸出
gpt-5.6-sol $5.00 $0.50 $6.25 $30.00
gpt-5.6-terra $2.00 $0.20 $2.50 $12.00
gpt-5.6-luna $0.20 $0.02 $0.25 $1.20
長上下文 Standard 價格更高:
模型 ID 輸入 快取輸入 快取寫入 輸出
gpt-5.6-sol $10.00 $1.00 $12.50 $45.00
gpt-5.6-terra $4.00 $0.40 $5.00 $18.00
gpt-5.6-luna $0.40 $0.04 $0.50 $1.80
不要只看輸入價格。 生成型任務的輸出 token 可能佔據大部分賬單,尤其是程式碼生成、長報告和多輪 Agent。 成本評估至少要記錄:
  • 未快取輸入 token;
  • 快取輸入 token;
  • 快取寫入 token;
  • 輸出 token;
  • Standard 與 Fast mode 的請求比例;
  • 短上下文與長上下文請求比例。

Luna 降價 80% 後意味著什麼

Luna 的輸入和輸出價格都變為原來的 20%。 舊的短上下文 Standard 價格是:

  • 輸入:$1.00 / 1M token;

  • 輸出:$6.00 / 1M token。 新的價格是:

  • 輸入:$0.20 / 1M token;

  • 輸出:$1.20 / 1M token。 假設一個批處理任務每月使用 1 億輸入 token 和 2,000 萬輸出 token: 舊價格估算:

1
2
3
输入:100 × $1.00 = $100
输出:20 × $6.00 = $120
合计:$220

新價格估算:

1
2
3
输入:100 × $0.20 = $20
输出:20 × $1.20 = $24
合计:$44

在 token 用量不變的情況下,這個示例的費用從 220 美元降到 44 美元。 但價格下降不代表所有任務都應該遷移到 Luna。 先用真實請求檢查指令遵循、結構化輸出、工具呼叫和錯誤率。 如果模型變便宜,卻導致重試次數或人工修正增加,總成本未必真的下降。

Terra 降價 20% 後如何計算

Terra 的舊短上下文 Standard 價格是:

  • 輸入:$2.50 / 1M token;

  • 輸出:$15.00 / 1M token。 新價格是:

  • 輸入:$2.00 / 1M token;

  • 輸出:$12.00 / 1M token。 假設每月使用 1 億輸入 token 和 2,000 萬輸出 token: 舊價格估算:

1
2
3
输入:100 × $2.50 = $250
输出:20 × $15.00 = $300
合计:$550

新價格估算:

1
2
3
输入:100 × $2.00 = $200
输出:20 × $12.00 = $240
合计:$440

示例每月可減少 110 美元,降幅正好是 20%。 Terra 更適合已經把它作為預設生產模型的團隊。 不需要改模型 ID,賬單會按新價格計算。

Fast mode 是什麼

Fast mode 是原 Priority Processing 的新名稱。 它仍然是按量付費的低延遲處理方式,但官方把產品定位和引數名稱變得更直觀。 Fast mode 的目標是:

  • 降低響應等待時間;
  • 提供更穩定的延遲;
  • 保留按量付費方式;
  • 服務有穩定流量的高價值使用者請求。 對 gpt-5.6-sol,Fast mode 最高可達到 Standard 的 2.5 倍速度。 “最高 2.5 倍”不是每個請求都固定提升 2.5 倍。 實際延遲仍與輸入長度、輸出長度、工具呼叫、網路和系統負載有關。

Fast mode 最新價格

當前短上下文 Fast mode 價格如下:

模型 ID 輸入 快取輸入 快取寫入 輸出
gpt-5.6-sol $10.00 $1.00 $12.50 $60.00
gpt-5.6-terra $4.00 $0.40 $5.00 $24.00
gpt-5.6-luna $0.40 $0.04 $0.50 $2.40
Fast mode 的每項 token 價格都是對應 Standard 短上下文價格的 2 倍。 以 Sol 為例,如果一次業務週期使用 1,000 萬輸入 token 和 200 萬輸出 token: Standard:
1
2
3
输入:10 × $5.00 = $50
输出:2 × $30.00 = $60
合计:$110

Fast mode:

1
2
3
输入:10 × $10.00 = $100
输出:2 × $60.00 = $120
合计:$220

是否值得多付 110 美元,要看延遲下降能否改善轉化率、任務完成率或人工效率。

單個請求啟用 Fast mode

Responses API 使用 service_tier: "fast"

1
2
3
4
5
6
7
8
curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-sol",
    "input": "分析这段错误日志并给出修复顺序",
    "service_tier": "fast"
  }'

Python SDK 示例:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="分析这段错误日志并给出修复顺序",
    service_tier="fast",
)

print(response.output_text)

Fast mode 同時可用於 Responses API 和 Chat Completions API。

舊的 priority 引數需要修改嗎

不需要立即修改。 下面的舊請求仍然有效:

1
2
3
4
5
response = client.responses.create(
    model="gpt-5.6-sol",
    input="检查这个发布方案",
    service_tier="priority",
)

對於受支援模型,priorityfast 會獲得相同的處理行為。 建議新程式碼使用 fast,因為名稱與當前文件一致。 舊程式碼可以按正常釋出週期逐步遷移,不必緊急全量替換。 需要特別注意響應物件。 對 GPT-5.6 及更早模型,即使請求寫的是 fast,響應裡的 service_tier 仍可能返回 priority。 因此,監控系統不要把返回 priority 直接判斷為配置沒有生效。

在專案級別預設啟用 Fast mode

如果專案中的大部分使用者請求都需要低延遲,可以在專案設定中啟用:

  1. 開啟 OpenAI API Platform 的專案設定;
  2. 進入 General
  3. 找到 Project Service Tier
  4. 選擇 Fast。 設定後,沒有顯式傳入 service_tier 的請求會逐步轉向 Fast mode。 官方說明專案請求會隨時間漸進切換。 不要把設定儲存後的第一分鐘資料當作最終結果。 更穩妥的方式是先按請求啟用,用功能開關控制少量流量,再決定是否改專案預設值。

速率限制並不會翻倍

Fast mode 和 Standard 處理共享同一個模型速率限制。 啟用 Fast mode 不會自動增加 TPM 或 RPM 配額。 原有的重試、退避和併發控制仍然需要保留。 如果系統因為更快返回而立即發出更多後續請求,反而可能更快觸發速率限制。 驗證時應同時觀察:

  • 請求延遲;
  • 429 響應;
  • 每分鐘 token;
  • 併發任務數;
  • 重試次數;
  • 實際完成時間。

突發流量可能被降級到 Standard

Fast mode 有 ramp rate limit。 當流量至少達到每分鐘 100 萬 token,並且 15 分鐘內 TPM 增長超過 50% 時,部分 Fast mode 請求可能被降級。 降級後:

  • 請求按 Standard 速度處理;

  • 費用按 Standard 價格計算;

  • 響應中的 service_tierdefault。 降低觸發風險的方法包括:

  • 切換模型或快照時逐步放量;

  • 使用功能開關在數小時內遷移流量;

  • 避免把大型 ETL 或批處理任務放進 Fast mode;

  • 保留 Standard 降級路徑;

  • 按服務層級統計延遲和費用。

哪些場景不適合 Fast mode

Fast mode 適合延遲直接影響使用者體驗的請求,例如:

  • 實時編碼助手;

  • 互動式 Agent;

  • 使用者正在等待的複雜分析;

  • 高價值客服或銷售流程;

  • 對首字延遲和總耗時敏感的產品。 不適合的場景包括:

  • 離線批處理;

  • 夜間資料清洗;

  • 對完成時間不敏感的佇列;

  • 可以使用 Batch 或 Flex 的任務;

  • 大規模 ETL;

  • 只為跑分而開啟的全量流量。 如果使用者不會感知幾十秒的差異,支付 2 倍 token 價格通常沒有必要。

Fast mode 當前功能限制

官方文件列出的限制包括:

  • 不支援長上下文;
  • 不支援微調模型;
  • 不支援 Embeddings;
  • 地區可用性取決於當地法律和監管;
  • 不保證未來每個 GPT 模型都支援;
  • Scale Tier 與 Fast mode 分開計費。 Fast mode 支援 Standard 模式已有的多模態能力,包括影象輸入。 快取輸入仍然可以享受折扣。 Fast mode 相容資料駐留、Zero Data Retention 和 BAA,但原有端點、工具、資格和合同要求仍然適用。

如何驗證 Fast mode 是否真的更快

不要只執行一次請求就下結論。 準備一組真實業務樣本,分別用 Standard 和 Fast mode 執行。 至少記錄:

指標 目的
首字延遲 判斷使用者多久看到第一個輸出
完整響應時間 判斷任務總等待時間
P50、P95、P99 避免平均值掩蓋長尾延遲
輸入與輸出 token 確認兩組請求工作量相近
service_tier 識別 Fast、相容 priority 或降級 default
錯誤和重試 排除限流造成的假性變慢
每次成功任務成本 判斷速度收益是否值得溢價
同一個提示至少重複多次,並儘量在相近流量條件下比較。 Agent 工作流還要記錄工具呼叫等待時間。 如果瓶頸在資料庫、瀏覽器或第三方 API,模型加速並不會讓整個任務快 2.5 倍。

一套安全的遷移步驟

生產環境可以按以下順序遷移:

  1. 保留當前 Standard 基線資料;
  2. 選擇最依賴低延遲的一個介面;
  3. 給 1% 流量設定 service_tier: "fast"
  4. 比較 P50、P95、成功率和單位任務成本;
  5. 檢查響應中的 prioritydefault
  6. 逐步擴大到 5%、10% 和 25%;
  7. 觀察是否觸發 ramp rate limit;
  8. 確認業務指標改善後再繼續放量;
  9. 不需要低延遲的任務繼續使用 Standard、Batch 或 Flex;
  10. 最後再考慮專案級預設啟用。 不要只按模型名稱統一切換整個組織。 同一個專案中的介面對延遲和成本可能有完全不同的敏感度。

如何在 Luna、Terra、Sol 之間重新分流

降價後可以重新設計任務路由:

  • Luna:高吞吐、規則明確、可自動驗收的輕量任務;
  • Terra:預設生產流量和中等複雜度任務;
  • Sol:複雜推理、困難編碼和高價值失敗重試;
  • Sol Fast mode:使用者正在等待且延遲會影響業務結果的複雜請求。 先由 Luna 或 Terra 處理,再把失敗或低置信度請求升級到 Sol,通常比所有請求直接進入 Sol 更省錢。 Fast mode 應該是延遲路由,而不是能力路由。 它不會把 Luna 變成 Sol,也不會自動提高模型答案質量。

常見問題

Luna 和 Terra 的模型 ID 變了嗎

沒有。 仍然使用 gpt-5.6-lunagpt-5.6-terra,價格從 2026 年 7 月 30 日起調整。

Sol 的 Standard 價格下降了嗎

官方本次更新重點是 Luna、Terra 降價,以及 Sol 的 Fast mode 提速。 Sol Standard 短上下文價格仍是輸入 5 美元、輸出 30 美元。

priority 會被廢棄嗎

當前官方文件明確說明 priorityfast 都可使用。 新程式碼建議使用 fast,舊程式碼可以逐步遷移。

為什麼請求寫 fast,響應卻返回 priority

這是 GPT-5.6 及更早模型的當前相容行為。 不要僅憑響應名稱判斷請求未進入 Fast mode。

Fast mode 一定快 2.5 倍嗎

不是。 官方表述是最高 2.5 倍,具體請求會受長度、負載、工具呼叫和網路影響。

Fast mode 會增加速率限制嗎

不會。 Fast mode 與 Standard 共享模型速率限制。

突發流量降級後怎麼收費

降級請求會按 Standard 速度和 Standard 價格處理,響應的 service_tier 會顯示 default

快取輸入還能享受折扣嗎

可以。 Fast mode 仍適用符合條件的快取輸入折扣。

總結

GPT-5.6 的這次調整同時改變了成本和延遲策略。 Luna 降價 80%,讓高吞吐輕量任務的成本明顯下降。 Terra 降價 20%,直接降低預設生產流量的費用。 Sol Standard 價格不變,但 Fast mode 提供最高 2.5 倍速度,代價是 2 倍 token 價格。 舊的 service_tier: "priority" 仍然相容,不需要緊急修改所有程式碼。 新接入建議使用 service_tier: "fast",並按介面逐步放量。 真正需要驗證的不是“速度是否更快”,而是更快的響應能否改善業務結果。 如果延遲收益無法覆蓋價格溢價,繼續使用 Standard、Batch 或 Flex 會更合理。