Claude Opus 5 發布:API 價格、Fast Mode、效能與 Opus 4.8 遷移指南

Claude Opus 5 已上線 Claude、Claude Code 與 API。本文整理模型定位、API 價格、Fast Mode、呼叫範例、安全回退機制,以及從 Opus 4.8 遷移時需要完成的測試清單。

Anthropic 於 2026 年 7 月 24 日發布 Claude Opus 5。它並不是單純把基準分數再向上推一點,而是試圖在前沿能力、任務成本和自主工作能力之間取得更實用的平衡:官方稱其能力接近 Claude Fable 5,但價格只有後者的一半;與 Opus 4.8 相比,基礎 API 單價保持不變。

對於開發者,最直接的變化是新模型標識已經可用:

1
claude-opus-5

本文不只羅列發布數據,還會回答更實際的問題:是否值得從 Opus 4.8 升級、一次典型 API 請求要花多少錢、Fast Mode 適合什麼場景,以及安全分類器觸發後的回退機制會怎樣影響生產系統。

Quick Answer:Claude Opus 5 值得升級嗎?

如果你的任務包含長連結程式設計、跨工具操作、複雜故障定位、科學研究分析或需要模型主動驗證結果,Opus 5 值得優先做一輪迴歸測試。它的優勢並非只在一次回答的質量,而是能夠自行製定步驟、調用工具、發現錯誤並繼續修正。

如果你的應用程式主要是短文字分類、固定格式抽取或成本敏感的高並發請求,則不應只因為「新模型」就直接切換。先使用現有真實流量建立測試集,比較成功率、輸出 token、端對端耗時和每個成功任務的成本,再決定是否遷移。

可以先記住四個結論:

  1. API 模型 ID 是 claude-opus-5
  2. 基礎價格為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元,與 Opus 4.8 相同。
  3. Fast Mode 約為預設模式的 2.5 倍速度,但價格為基礎費率的 2 倍。
  4. Claude 網頁端、Claude Code、Cowork 與 API 均已提供 Opus 5,但不同訂閱方案中的預設位置不同。

Claude Opus 5 的產品定位

Anthropic 在發布說明中把 Opus 5 描述為一款更「周到且主動」的模型。這裡的主動並不是未經允許執行危險操作,而是面對開放式任務時,能夠補齊必要步驟、創建測試工具並檢查自己的結果。

官方給出的幾個案例很能說明這種變化:

  • 在 FreeCAD 中完成電腦視覺管線,而不是只產生一段孤立程式碼;
  • 定位一個套件管理器問題的根本原因,而不是停留在表面報錯;
  • 建立交易市場資料來源,並自行建立測試工具驗證行為。

這類任務有一個共同點:使用者給的目標通常不完整,模型必須在多個步驟之間保持狀態,也要判斷何時需要驗證。對 Claude Code、內部研發代理商和桌面自動化而言,這比單輪問答分數更有參考價值。

與 Opus 4.8、Fable 5、Mythos 5 怎麼比較?

根據 Anthropic 的官方定位,可以做如下理解:

模型 更適合的定位 官方比較中的關鍵資訊
Claude Opus 4.8 已穩定運作的現有 Opus 工作負載 Opus 5 保持相同基礎單價,並在多項能力上提升
Claude Opus 5 高難度通用代理、編程、科研和工具操作 接近 Fable 5 的前沿智能,價格約為其一半
Claude Fable 5 追求最高能力上限的任務 CursorBench 3.2 中仍保持極小領先,但任務成本更高
Claude Mythos 5 更偏前沿網路安全能力 官方明確表示 Opus 5 在網路安全方面落後於 Mythos 5

這張表不能取代你自己的測試。尤其是「接近」「領先」等結論都依賴特定基準、努力等級和工具環境,不能直接等同於所有業務場景中的效果。

官方公佈了哪些效能提升?

Anthropic 公佈的結果主要涵蓋代理任務、程式設計、電腦操作、科學研究和視覺輸出。

1. 代理與真實工作任務

在 Frontier-Bench v0.1 上,Opus 5 的表現超過 Opus 4.8 的兩倍,同時每個任務的成本更低。 Anthropic 也表示,Opus 5 在 Frontier-Bench 和 GDPval-AA 上達到新的最佳成績。

這些基準更著重於完成整個任務,而不是回答一道靜態題目,因此對代理類應用有一定參考價值。但生產環境也應記錄失敗後的重試次數,因為一次運行價格較高、卻能減少兩次重試的模型,最終可能更便宜。

2. 程式設計與工具使用

在 CursorBench 3.2 的最高努力設定下,Opus 5 距離 Fable 5 的最佳成績只有 0.5%,每個任務的成本則約為後者的一半。

官方也強調了模型對複雜工具鏈的處理能力。遷移 Claude Code 工作流程時,建議專注於測試以下類型的任務:

  • 跨多個文件追蹤 bug;
  • 讀取日誌後定位根因並補充測試;
  • 修改程式碼後執行建置、測試和格式檢查;
  • 在需求不完整時識別約束,而不是過早提交實現;
  • 需要連續呼叫多個 MCP 工具的操作流程。

3. 電腦操作與自動化

在 OSWorld 2.0 中,Opus 5 在相近成本下超過其他模型;官方稱它以略高於 Fable 5 三分之一的成本,超過了後者的最佳成績。

在 Zapier AutomationBench 上,Opus 5 的得分約為同等任務成本下次優模型的 1.5 倍。即使採用最低努力等級,它仍完成了最多任務。

這意味著低努力等級不一定只適合簡單聊天。對於結構明確的自動化任務,它可能成為控制 token 和延遲的實用選擇。

4. 科學研究與視覺任務

Anthropic 表示,Opus 5 在所有生命科學評測上都優於 Opus 4.8。其中內部有機化學評測提高 10.2 個百分點,蛋白質變異評測提高 7.7 個百分點。

此外,模型產生的網頁、幻燈片和其他視覺成果也有所改進。不過這些仍然是發布者提供的評測和範例。涉及科學研究結論、醫療資訊或實驗​​設計時,必須保留人工複查和來源驗證,不能把更高基準分數當作事實正確性的保證。

Claude Opus 5 API 價格

Opus 5 的基礎 API 價格如下:

項目 價格
輸入 token 5 美元 / 100 萬 token
輸出 token 25 美元 / 100 萬 token
Fast Mode 基本費率的 2 倍

以上是發布說明中所給的基礎價格。提示快取、批次或雲端平台頻道可能採用不同計費規則,正式預算仍應以呼叫頻道當時的帳單說明為準。

一次要求大約多少錢?

假設一個長任務累計使用:

  • 輸入 100 萬 token;
  • 輸出 20 萬 token。

預設模式的基礎費用為:

1
2
3
输入:1 × 5 美元 = 5 美元
输出:0.2 × 25 美元 = 5 美元
合计:10 美元

如果相同 token 用量全部以 Fast Mode 的兩倍費率計算,則約為 20 美元。

真實代理任務不能只按單次呼叫估算。更有用的指標是「每個成功任務成本」:

1
每个成功任务成本 = 总调用费用 ÷ 最终成功完成的任务数

一個便宜模型如果頻繁重試、需要人工接管,最終成本可能比 Opus 5 更高;反過來,簡單任務使用 Opus 5 也可能沒有足夠收益。

使用 API 呼叫 Claude Opus 5

curl 範例

先把 API Key 放入環境變量,再呼叫 Messages API。不要把真實密鑰寫進腳本或提交到 Git 倉庫。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
export ANTHROPIC_API_KEY="your-api-key"

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "messages": [
      {
        "role": "user",
        "content": "分析这个服务的错误日志,给出根因、验证步骤和最小修复方案。"
      }
    ]
  }'

Windows PowerShell 中可以先設定目前會話環境變數:

1
$env:ANTHROPIC_API_KEY = "your-api-key"

然後使用 Anthropic SDK,或按照當前官方文件構造請求。環境變數只對目前 PowerShell 會話生效,更適合臨時測試。

Python SDK 範例

安裝 SDK:

1
python -m pip install -U anthropic

建立最小呼叫腳本:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
from anthropic import Anthropic

client = Anthropic()

message = client.messages.create(
    model="claude-opus-5",
    max_tokens=1024,
    messages=[
        {
            "role": "user",
            "content": (
                "检查下面的部署故障。先列假设,再给验证命令;"
                "没有证据时不要直接修改配置。"
            ),
        }
    ],
)

print(message.content[0].text)
print(message.usage)

生產環境至少應額外記錄:

  • 請求使用的模型 ID;
  • 輸入與輸出 token;
  • 總耗時且首 token 延遲;
  • 工具呼叫次數與失敗原因;
  • 是否發生模型回退;
  • 最終任務是否由人工接手。

只記錄 HTTP 200 並不足以衡量代理任務是否成功。

Fast Mode 適合什麼場景?

Opus 5 的 Fast Mode 速度約為預設模式的 2.5 倍,價格則為基礎費率的 2 倍。 Claude Platform 可以使用該模式,Claude Code 也可透過 usage credits 使用。

適合優先測試 Fast Mode 的場景包括:

  • 開發者正在等待的互動式 Claude Code 會話;
  • 需要快速迭代的線上事故分析;
  • 演示、結對程式設計和即時工具操作;
  • 延遲對業務價值的影響高於單次 token 成本的流程。

不適合預設開啟的場景包括:

  • 夜間批次處理;
  • 可以排隊運行的離線程式碼審查;
  • 大規模低優先級資料整理;
  • 尚未建立費用上限和監控的代理商循環。

建議為 Fast Mode 設定獨立預算標籤,並比較 P50、P95 延遲和每個成功任務成本。光是看到「快 2.5 倍」就給所有請求開啟,通常無法得到最優成本結構。

Effort 設定如何使用?

Opus 5 提供不同 effort 設置,用於在智慧等級、token 用量、延遲與成本之間取捨。 Anthropic 的發布數據表明,低 effort 在部分自動化基準中仍具有競爭力,而最高 effort 更適合逼近模型能力上限。

可以採用分層策略:

任務 建議起點 升級條件
格式轉換、固​​定規則抽取 低 effort 格式錯誤或遺漏率超標
常規編碼、單一倉庫排錯 中 effort 多次工具呼叫後仍無法定位
跨系統故障、架構設計 高 effort 任務價值足以涵蓋額外 token
前沿研究或高難度代理評測 最高 effort 需要驗證能力上限

具體參數名稱和可用範圍可能隨 SDK 或平台更新,不應憑發布稿猜測請求欄位。存取時應以所用 API 版本的官方文件為準。

從 Claude Opus 4.8 遷移到 Opus 5

不要只把模型字串替換後立即全量上線。更穩健的遷移流程如下。

第一步:固定真實測試集

從生產日誌中選取 30 至 100 個已減敏任務,覆蓋:

  • 正常成功案例;
  • 曾經需要重試的案例;
  • 工具呼叫失敗案例;
  • 長上下文和高輸出任務;
  • 可能觸發安全分類器的合法任務。

測驗集應保留預期結果或人工評分標準,否則只能比較文風,無法比較任務成功率。

第二步:只修改模型 ID

先保持提示字、工具定義、最大輸出長度和逾時不變,把模型切換為:

1
claude-opus-5

這樣可以把模型變化與其他配置變化分開。若同時重寫提示詞和工具 schema,出現迴歸時很難定位原因。

第三步:比較四類指標

至少比較:

  1. 最終任務成功率;
  2. 輸入、輸出和總 token;
  3. P50、P95 端對端延遲;
  4. 每個成功任務的實際成本。

代理任務也應單獨記錄工具呼叫次數、無效循環次數和人工接管率。

第四步:重新校準提示詞

Opus 5 較主動,舊提示詞中大量「請繼續檢查」「請自行驗證」的重複指示可能不再必要。可以逐步刪除冗餘要求,但必須保留業務邊界,例如:

  • 未經批准不得部署;
  • 不得刪除生產數據;
  • 修改前先輸出證據;
  • 密鑰和個人資訊不得進入日誌;
  • 高風險操作必須等待人工確認。

主動性增強不等於授權範圍擴大。

第五步:灰階發布並保留回退

先將少量流量切到 Opus 5,再逐步擴大。回退條件可以包括:

  • 錯誤率超過閾值;
  • P95 延遲明顯惡化;
  • 單任務成本超出預算;
  • 工具呼叫出現重複循環;
  • 安全分類器回退比例異常上升。

回退策略本身也要測試,不能等生產請求觸發後才確認日誌和回應格式是否相容。

兩項 API Beta 更新

Anthropic 同時介紹了兩項與 Opus 5 配合的 API Beta 能力。

對話中途修改工具

應用程式可以在對話進行過程中更改可用工具,而不會讓提示快取失效。這對長時間運行的代理很有用:系統可以按任務階段載入資料庫、瀏覽器或部署工具,不必從一開始就把所有工具定義塞進上下文。

潛在收益包括:

  • 減少無關工具對模型選擇的干擾;
  • 保留提示緩存,降低重複上下文成本;
  • 依據權限和任務狀態動態開放工具;
  • 縮小高風險工具的暴露時間視窗。

分類器觸發後的自動模型回退

API 可以在安全分類器標記請求後自動切換到另一個模型。預設設定會選擇目前可用的最佳替代模型,也可以根據業務需求配置回退策略。

接取該功能時,應將「實際回應模型」納入可觀測性。否則應用程式看到請求成功,卻不知道同一測試集為何出現輸出風格、延遲或能力差異。

安全機制會如何影響開發者?

Anthropic 表示,Opus 5 在自動化對齊稽核中的整體不當行為得分為 2.3,是近期模型中最低的。同時,官方認為它沒有推進高風險雙用途能力的前沿,在生物和進攻性網路安全方面落後於 Mythos 5。

網路安全場景的邊界尤其值得注意:

  • 原始碼漏洞發現可以被允許;
  • 二進位漏洞掃描、滲透測試和漏洞利用產生可能被阻止;
  • Opus 5 的漏洞發現能力有所提高,但漏洞利用開發仍明顯落後於 Mythos 5;
  • 新分類器預計比 Fable 5 減少約 85% 的干預。

在 Claude.ai、Claude Code 和 Cowork 中,被標記的請求預設會回退到 Opus 4.8。 API 使用者也可以啟用回退。 Claude Verified Participants 計劃中的用戶可以在更少限制下存取相關能力。

對普通開發團隊而言,最重要的不是嘗試繞過分類器,而是區分合法的防禦性任務,並為被阻止或回退的請求提供明確的使用者提示和人工處理路徑。

Claude Pro、Max、Claude Code 和 API 怎麼選?

使用方式 適合人群 Opus 5 的位置
Claude Pro 個人日常研究、寫作和開發 官方稱其為 Pro 中最強模型
Claude Max 高頻專業用戶 Opus 5 已是預設模型
Claude Code 終端內編碼與代理任務 可直接用於編程工作流程,Fast Mode 可透過 usage credits 使用
Claude API 產品整合、批次和自建代理 使用 claude-opus-5,可自行控制流量、預算和回退

如果只是評估輸出質量,可以先在 Claude 應用程式中建立測試範例;如果要測量 token、工具呼叫、錯誤率和成本,則應使用 API 或現有的工程評測架構。

上線前檢查清單

  • 模型 ID 已改為 claude-opus-5,且沒有誤改其他環境;
  • API Key 透過環境變數或金鑰管理服務提供;
  • 使用真實、減敏的生產任務建立回歸測試集;
  • 記錄輸入輸出 token、延遲、工具呼叫和成功率;
  • 以「每個成功任務」比較成本,而不只比較單價;
  • Fast Mode 有獨立預算與監控;
  • effort 從低或中等設定開始,依失敗條件升級;
  • 高風險工具仍受權限及人工確認控制;
  • 自動模型回退在日誌中可見;
  • 灰階發布期間保留 Opus 4.8 回退路徑。

常見問題

Claude Opus 5 的 API 模型名稱是什麼?

官方公佈的模型 ID 是 claude-opus-5

Opus 5 比 Opus 4.8 更貴嗎?

基礎 API 單價沒有提高,仍為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元。不過實際帳單還取決於輸出長度、重試、快取、工具循環和是否啟用 Fast Mode。

Fast Mode 會提升模型品質嗎?

官方強調的是速度提升,而不是更高智慧。它約為預設模式的 2.5 倍速度,價格為基礎費率的 2 倍。是否值得使用應以交互延遲帶來的業務價值來衡量。

現有 Opus 4.8 提示詞能直接使用嗎?

通常可以作為遷移起點,但不應跳過回歸測試。 Opus 5 較主動,舊提示詞可能包含冗餘步驟;工具呼叫、安全邊界和回退行為也需要重新驗證。

Opus 5 適合網路安全工作嗎?

它可以支援合法的原始碼漏洞發現和防禦性分析,但官方分類器會限制二進位掃描、滲透測試和漏洞產生等高風險請求。相關團隊應按授權範圍設計工作流程,並預期部分請求可能被阻止或回退。

總結

Claude Opus 5 的核心價值,是以與 Opus 4.8 相同的基礎價格,提供更強的代理執行、程式設計、電腦操作和科學研究能力。它與 Fable 5 的差距在部分程式設計評測中已經很小,但任務成本更低;同時,Anthropic 透過分類器和自動回退限制高風險網路安全能力。

對現有用戶,最合理的動作不是立即全量切換,而是用真實任務完成一次受控遷移:固定測試集,只更換模型 ID,比較成功率、延遲和每個成功任務成本,再逐步調整 effort、Fast Mode 與提示詞。這樣才能判斷 Opus 5 帶來的究竟是更高基準分數,還是可量化的生產效率提升。

參考資料