Anthropic 於 2026 年 7 月 24 日發布 Claude Opus 5。它並不是單純把基準分數再向上推一點,而是試圖在前沿能力、任務成本和自主工作能力之間取得更實用的平衡:官方稱其能力接近 Claude Fable 5,但價格只有後者的一半;與 Opus 4.8 相比,基礎 API 單價保持不變。
對於開發者,最直接的變化是新模型標識已經可用:
|
|
本文不只羅列發布數據,還會回答更實際的問題:是否值得從 Opus 4.8 升級、一次典型 API 請求要花多少錢、Fast Mode 適合什麼場景,以及安全分類器觸發後的回退機制會怎樣影響生產系統。
Quick Answer:Claude Opus 5 值得升級嗎?
如果你的任務包含長連結程式設計、跨工具操作、複雜故障定位、科學研究分析或需要模型主動驗證結果,Opus 5 值得優先做一輪迴歸測試。它的優勢並非只在一次回答的質量,而是能夠自行製定步驟、調用工具、發現錯誤並繼續修正。
如果你的應用程式主要是短文字分類、固定格式抽取或成本敏感的高並發請求,則不應只因為「新模型」就直接切換。先使用現有真實流量建立測試集,比較成功率、輸出 token、端對端耗時和每個成功任務的成本,再決定是否遷移。
可以先記住四個結論:
- API 模型 ID 是
claude-opus-5。 - 基礎價格為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元,與 Opus 4.8 相同。
- Fast Mode 約為預設模式的 2.5 倍速度,但價格為基礎費率的 2 倍。
- Claude 網頁端、Claude Code、Cowork 與 API 均已提供 Opus 5,但不同訂閱方案中的預設位置不同。
Claude Opus 5 的產品定位
Anthropic 在發布說明中把 Opus 5 描述為一款更「周到且主動」的模型。這裡的主動並不是未經允許執行危險操作,而是面對開放式任務時,能夠補齊必要步驟、創建測試工具並檢查自己的結果。
官方給出的幾個案例很能說明這種變化:
- 在 FreeCAD 中完成電腦視覺管線,而不是只產生一段孤立程式碼;
- 定位一個套件管理器問題的根本原因,而不是停留在表面報錯;
- 建立交易市場資料來源,並自行建立測試工具驗證行為。
這類任務有一個共同點:使用者給的目標通常不完整,模型必須在多個步驟之間保持狀態,也要判斷何時需要驗證。對 Claude Code、內部研發代理商和桌面自動化而言,這比單輪問答分數更有參考價值。
與 Opus 4.8、Fable 5、Mythos 5 怎麼比較?
根據 Anthropic 的官方定位,可以做如下理解:
| 模型 | 更適合的定位 | 官方比較中的關鍵資訊 |
|---|---|---|
| Claude Opus 4.8 | 已穩定運作的現有 Opus 工作負載 | Opus 5 保持相同基礎單價,並在多項能力上提升 |
| Claude Opus 5 | 高難度通用代理、編程、科研和工具操作 | 接近 Fable 5 的前沿智能,價格約為其一半 |
| Claude Fable 5 | 追求最高能力上限的任務 | CursorBench 3.2 中仍保持極小領先,但任務成本更高 |
| Claude Mythos 5 | 更偏前沿網路安全能力 | 官方明確表示 Opus 5 在網路安全方面落後於 Mythos 5 |
這張表不能取代你自己的測試。尤其是「接近」「領先」等結論都依賴特定基準、努力等級和工具環境,不能直接等同於所有業務場景中的效果。
官方公佈了哪些效能提升?
Anthropic 公佈的結果主要涵蓋代理任務、程式設計、電腦操作、科學研究和視覺輸出。
1. 代理與真實工作任務
在 Frontier-Bench v0.1 上,Opus 5 的表現超過 Opus 4.8 的兩倍,同時每個任務的成本更低。 Anthropic 也表示,Opus 5 在 Frontier-Bench 和 GDPval-AA 上達到新的最佳成績。
這些基準更著重於完成整個任務,而不是回答一道靜態題目,因此對代理類應用有一定參考價值。但生產環境也應記錄失敗後的重試次數,因為一次運行價格較高、卻能減少兩次重試的模型,最終可能更便宜。
2. 程式設計與工具使用
在 CursorBench 3.2 的最高努力設定下,Opus 5 距離 Fable 5 的最佳成績只有 0.5%,每個任務的成本則約為後者的一半。
官方也強調了模型對複雜工具鏈的處理能力。遷移 Claude Code 工作流程時,建議專注於測試以下類型的任務:
- 跨多個文件追蹤 bug;
- 讀取日誌後定位根因並補充測試;
- 修改程式碼後執行建置、測試和格式檢查;
- 在需求不完整時識別約束,而不是過早提交實現;
- 需要連續呼叫多個 MCP 工具的操作流程。
3. 電腦操作與自動化
在 OSWorld 2.0 中,Opus 5 在相近成本下超過其他模型;官方稱它以略高於 Fable 5 三分之一的成本,超過了後者的最佳成績。
在 Zapier AutomationBench 上,Opus 5 的得分約為同等任務成本下次優模型的 1.5 倍。即使採用最低努力等級,它仍完成了最多任務。
這意味著低努力等級不一定只適合簡單聊天。對於結構明確的自動化任務,它可能成為控制 token 和延遲的實用選擇。
4. 科學研究與視覺任務
Anthropic 表示,Opus 5 在所有生命科學評測上都優於 Opus 4.8。其中內部有機化學評測提高 10.2 個百分點,蛋白質變異評測提高 7.7 個百分點。
此外,模型產生的網頁、幻燈片和其他視覺成果也有所改進。不過這些仍然是發布者提供的評測和範例。涉及科學研究結論、醫療資訊或實驗設計時,必須保留人工複查和來源驗證,不能把更高基準分數當作事實正確性的保證。
Claude Opus 5 API 價格
Opus 5 的基礎 API 價格如下:
| 項目 | 價格 |
|---|---|
| 輸入 token | 5 美元 / 100 萬 token |
| 輸出 token | 25 美元 / 100 萬 token |
| Fast Mode | 基本費率的 2 倍 |
以上是發布說明中所給的基礎價格。提示快取、批次或雲端平台頻道可能採用不同計費規則,正式預算仍應以呼叫頻道當時的帳單說明為準。
一次要求大約多少錢?
假設一個長任務累計使用:
- 輸入 100 萬 token;
- 輸出 20 萬 token。
預設模式的基礎費用為:
|
|
如果相同 token 用量全部以 Fast Mode 的兩倍費率計算,則約為 20 美元。
真實代理任務不能只按單次呼叫估算。更有用的指標是「每個成功任務成本」:
|
|
一個便宜模型如果頻繁重試、需要人工接管,最終成本可能比 Opus 5 更高;反過來,簡單任務使用 Opus 5 也可能沒有足夠收益。
使用 API 呼叫 Claude Opus 5
curl 範例
先把 API Key 放入環境變量,再呼叫 Messages API。不要把真實密鑰寫進腳本或提交到 Git 倉庫。
|
|
Windows PowerShell 中可以先設定目前會話環境變數:
|
|
然後使用 Anthropic SDK,或按照當前官方文件構造請求。環境變數只對目前 PowerShell 會話生效,更適合臨時測試。
Python SDK 範例
安裝 SDK:
|
|
建立最小呼叫腳本:
|
|
生產環境至少應額外記錄:
- 請求使用的模型 ID;
- 輸入與輸出 token;
- 總耗時且首 token 延遲;
- 工具呼叫次數與失敗原因;
- 是否發生模型回退;
- 最終任務是否由人工接手。
只記錄 HTTP 200 並不足以衡量代理任務是否成功。
Fast Mode 適合什麼場景?
Opus 5 的 Fast Mode 速度約為預設模式的 2.5 倍,價格則為基礎費率的 2 倍。 Claude Platform 可以使用該模式,Claude Code 也可透過 usage credits 使用。
適合優先測試 Fast Mode 的場景包括:
- 開發者正在等待的互動式 Claude Code 會話;
- 需要快速迭代的線上事故分析;
- 演示、結對程式設計和即時工具操作;
- 延遲對業務價值的影響高於單次 token 成本的流程。
不適合預設開啟的場景包括:
- 夜間批次處理;
- 可以排隊運行的離線程式碼審查;
- 大規模低優先級資料整理;
- 尚未建立費用上限和監控的代理商循環。
建議為 Fast Mode 設定獨立預算標籤,並比較 P50、P95 延遲和每個成功任務成本。光是看到「快 2.5 倍」就給所有請求開啟,通常無法得到最優成本結構。
Effort 設定如何使用?
Opus 5 提供不同 effort 設置,用於在智慧等級、token 用量、延遲與成本之間取捨。 Anthropic 的發布數據表明,低 effort 在部分自動化基準中仍具有競爭力,而最高 effort 更適合逼近模型能力上限。
可以採用分層策略:
| 任務 | 建議起點 | 升級條件 |
|---|---|---|
| 格式轉換、固定規則抽取 | 低 effort | 格式錯誤或遺漏率超標 |
| 常規編碼、單一倉庫排錯 | 中 effort | 多次工具呼叫後仍無法定位 |
| 跨系統故障、架構設計 | 高 effort | 任務價值足以涵蓋額外 token |
| 前沿研究或高難度代理評測 | 最高 effort | 需要驗證能力上限 |
具體參數名稱和可用範圍可能隨 SDK 或平台更新,不應憑發布稿猜測請求欄位。存取時應以所用 API 版本的官方文件為準。
從 Claude Opus 4.8 遷移到 Opus 5
不要只把模型字串替換後立即全量上線。更穩健的遷移流程如下。
第一步:固定真實測試集
從生產日誌中選取 30 至 100 個已減敏任務,覆蓋:
- 正常成功案例;
- 曾經需要重試的案例;
- 工具呼叫失敗案例;
- 長上下文和高輸出任務;
- 可能觸發安全分類器的合法任務。
測驗集應保留預期結果或人工評分標準,否則只能比較文風,無法比較任務成功率。
第二步:只修改模型 ID
先保持提示字、工具定義、最大輸出長度和逾時不變,把模型切換為:
|
|
這樣可以把模型變化與其他配置變化分開。若同時重寫提示詞和工具 schema,出現迴歸時很難定位原因。
第三步:比較四類指標
至少比較:
- 最終任務成功率;
- 輸入、輸出和總 token;
- P50、P95 端對端延遲;
- 每個成功任務的實際成本。
代理任務也應單獨記錄工具呼叫次數、無效循環次數和人工接管率。
第四步:重新校準提示詞
Opus 5 較主動,舊提示詞中大量「請繼續檢查」「請自行驗證」的重複指示可能不再必要。可以逐步刪除冗餘要求,但必須保留業務邊界,例如:
- 未經批准不得部署;
- 不得刪除生產數據;
- 修改前先輸出證據;
- 密鑰和個人資訊不得進入日誌;
- 高風險操作必須等待人工確認。
主動性增強不等於授權範圍擴大。
第五步:灰階發布並保留回退
先將少量流量切到 Opus 5,再逐步擴大。回退條件可以包括:
- 錯誤率超過閾值;
- P95 延遲明顯惡化;
- 單任務成本超出預算;
- 工具呼叫出現重複循環;
- 安全分類器回退比例異常上升。
回退策略本身也要測試,不能等生產請求觸發後才確認日誌和回應格式是否相容。
兩項 API Beta 更新
Anthropic 同時介紹了兩項與 Opus 5 配合的 API Beta 能力。
對話中途修改工具
應用程式可以在對話進行過程中更改可用工具,而不會讓提示快取失效。這對長時間運行的代理很有用:系統可以按任務階段載入資料庫、瀏覽器或部署工具,不必從一開始就把所有工具定義塞進上下文。
潛在收益包括:
- 減少無關工具對模型選擇的干擾;
- 保留提示緩存,降低重複上下文成本;
- 依據權限和任務狀態動態開放工具;
- 縮小高風險工具的暴露時間視窗。
分類器觸發後的自動模型回退
API 可以在安全分類器標記請求後自動切換到另一個模型。預設設定會選擇目前可用的最佳替代模型,也可以根據業務需求配置回退策略。
接取該功能時,應將「實際回應模型」納入可觀測性。否則應用程式看到請求成功,卻不知道同一測試集為何出現輸出風格、延遲或能力差異。
安全機制會如何影響開發者?
Anthropic 表示,Opus 5 在自動化對齊稽核中的整體不當行為得分為 2.3,是近期模型中最低的。同時,官方認為它沒有推進高風險雙用途能力的前沿,在生物和進攻性網路安全方面落後於 Mythos 5。
網路安全場景的邊界尤其值得注意:
- 原始碼漏洞發現可以被允許;
- 二進位漏洞掃描、滲透測試和漏洞利用產生可能被阻止;
- Opus 5 的漏洞發現能力有所提高,但漏洞利用開發仍明顯落後於 Mythos 5;
- 新分類器預計比 Fable 5 減少約 85% 的干預。
在 Claude.ai、Claude Code 和 Cowork 中,被標記的請求預設會回退到 Opus 4.8。 API 使用者也可以啟用回退。 Claude Verified Participants 計劃中的用戶可以在更少限制下存取相關能力。
對普通開發團隊而言,最重要的不是嘗試繞過分類器,而是區分合法的防禦性任務,並為被阻止或回退的請求提供明確的使用者提示和人工處理路徑。
Claude Pro、Max、Claude Code 和 API 怎麼選?
| 使用方式 | 適合人群 | Opus 5 的位置 |
|---|---|---|
| Claude Pro | 個人日常研究、寫作和開發 | 官方稱其為 Pro 中最強模型 |
| Claude Max | 高頻專業用戶 | Opus 5 已是預設模型 |
| Claude Code | 終端內編碼與代理任務 | 可直接用於編程工作流程,Fast Mode 可透過 usage credits 使用 |
| Claude API | 產品整合、批次和自建代理 | 使用 claude-opus-5,可自行控制流量、預算和回退 |
如果只是評估輸出質量,可以先在 Claude 應用程式中建立測試範例;如果要測量 token、工具呼叫、錯誤率和成本,則應使用 API 或現有的工程評測架構。
上線前檢查清單
- 模型 ID 已改為
claude-opus-5,且沒有誤改其他環境; - API Key 透過環境變數或金鑰管理服務提供;
- 使用真實、減敏的生產任務建立回歸測試集;
- 記錄輸入輸出 token、延遲、工具呼叫和成功率;
- 以「每個成功任務」比較成本,而不只比較單價;
- Fast Mode 有獨立預算與監控;
- effort 從低或中等設定開始,依失敗條件升級;
- 高風險工具仍受權限及人工確認控制;
- 自動模型回退在日誌中可見;
- 灰階發布期間保留 Opus 4.8 回退路徑。
常見問題
Claude Opus 5 的 API 模型名稱是什麼?
官方公佈的模型 ID 是 claude-opus-5。
Opus 5 比 Opus 4.8 更貴嗎?
基礎 API 單價沒有提高,仍為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元。不過實際帳單還取決於輸出長度、重試、快取、工具循環和是否啟用 Fast Mode。
Fast Mode 會提升模型品質嗎?
官方強調的是速度提升,而不是更高智慧。它約為預設模式的 2.5 倍速度,價格為基礎費率的 2 倍。是否值得使用應以交互延遲帶來的業務價值來衡量。
現有 Opus 4.8 提示詞能直接使用嗎?
通常可以作為遷移起點,但不應跳過回歸測試。 Opus 5 較主動,舊提示詞可能包含冗餘步驟;工具呼叫、安全邊界和回退行為也需要重新驗證。
Opus 5 適合網路安全工作嗎?
它可以支援合法的原始碼漏洞發現和防禦性分析,但官方分類器會限制二進位掃描、滲透測試和漏洞產生等高風險請求。相關團隊應按授權範圍設計工作流程,並預期部分請求可能被阻止或回退。
總結
Claude Opus 5 的核心價值,是以與 Opus 4.8 相同的基礎價格,提供更強的代理執行、程式設計、電腦操作和科學研究能力。它與 Fable 5 的差距在部分程式設計評測中已經很小,但任務成本更低;同時,Anthropic 透過分類器和自動回退限制高風險網路安全能力。
對現有用戶,最合理的動作不是立即全量切換,而是用真實任務完成一次受控遷移:固定測試集,只更換模型 ID,比較成功率、延遲和每個成功任務成本,再逐步調整 effort、Fast Mode 與提示詞。這樣才能判斷 Opus 5 帶來的究竟是更高基準分數,還是可量化的生產效率提升。