Anthropic 當前 Claude 模型怎麼選:Fable、Opus、Sonnet、Haiku 對比

對比 Anthropic 當前 Claude Fable 5、Opus 4.8、Sonnet 5、Haiku 4.5 和 Mythos 5 的定位、價格、上下文、延遲與適用場景。

Anthropic 當前的 Claude 模型線已經不再只是「Haiku 快、Sonnet 均衡、Opus 最強」這麼簡單。到 2026 年 7 月,官方主推的幾類模型包括 Claude Fable 5、Claude Opus 4.8、Claude Sonnet 5、Claude Haiku 4.5,以及受限開放的 Claude Mythos 5。

如果只想快速選型,可以先記住一句話:日常開發和多數 Agent 任務優先試 Sonnet 5;複雜企業級 Agent 和高難編碼用 Opus 4.8;追求最高能力再看 Fable 5;低延遲和成本敏感任務用 Haiku 4.5;Mythos 5 不是通用產品,只面向批准客戶。

當前主要模型一覽

模型 API ID / alias 定位 上下文 最大輸出 延遲傾向 標準價格
Claude Fable 5 claude-fable-5 Anthropic 當前廣泛發布模型裡的最高能力檔,適合長流程 Agent 1M tokens 128k tokens 較慢 輸入 $10 / MTok,輸出 $50 / MTok
Claude Opus 4.8 claude-opus-4-8 複雜 Agent 編碼、企業工作流、瀏覽器/電腦使用 1M tokens 128k tokens 中等 輸入 $5 / MTok,輸出 $25 / MTok
Claude Sonnet 5 claude-sonnet-5 速度、能力和價格最均衡,適合作預設模型 1M tokens 128k tokens 2026-08-31 前輸入 $2 / MTok,輸出 $10 / MTok;之後 $3 / $15
Claude Haiku 4.5 claude-haiku-4-5 最快、成本最低,適合高吞吐輕任務 200k tokens 64k tokens 最快 輸入 $1 / MTok,輸出 $5 / MTok
Claude Mythos 5 claude-mythos-5 與 Fable 5 同規格同價格,但受限開放 1M tokens 128k tokens 較慢 輸入 $10 / MTok,輸出 $50 / MTok

這裡的 MTok 指 million tokens,也就是百萬 token。價格還會受 prompt caching、batch、資料駐留、雲平台區域等因素影響,表格只放最常用的基礎輸入/輸出價格。

Fable 5:最高能力,但不是預設首選

Claude Fable 5 是 Anthropic 當前「廣泛發布」模型裡能力最高的一檔。官方給它的定位是 next-generation intelligence for long-running agents,也就是面向長流程 Agent 的下一代高能力模型。

它適合這些場景:

  • 長時間、多步驟、需要自主推進的 Agent 工作流。
  • 複雜研究、複雜程式碼遷移、跨系統規劃。
  • 需要最高推理能力和大上下文的企業任務。
  • 不太敏感於成本和延遲的高價值任務。

但 Fable 5 不一定適合作為預設模型。它價格最高,延遲也更慢。除非任務確實需要最高能力,否則從 Sonnet 5 或 Opus 4.8 開始測試通常更穩。

還要注意一點:Fable 5 使用 adaptive thinking,而且是 always on。這意味著它會自動決定什麼時候推理、推理多少;這對複雜任務有幫助,但也會讓成本和回應時間更依賴任務本身。

Opus 4.8:複雜編碼和企業 Agent 的穩妥選擇

Claude Opus 4.8 處在 Fable 5 和 Sonnet 5 之間。官方建議,如果不確定複雜 Agent 編碼和企業工作該用什麼模型,可以從 Opus 4.8 開始。

它的優勢是:

  • 1M token 上下文。
  • 128k token 最大輸出。
  • 複雜編碼、瀏覽器 Agent、電腦使用和企業工作流表現強。
  • 價格只有 Fable 5 的一半。
  • 支援 adaptive thinking。

Opus 4.8 適合放在「高難任務預設模型」的位置。程式碼庫級重構、複雜 PR 修復、企業資料分析、多工具 Agent、長文檔推理等,都可以先用 Opus 4.8 做基準。

如果任務非常難,Opus 4.8 不夠,再升級 Fable 5;如果任務量很大、成本壓力明顯,再下放到 Sonnet 5。

這次更新的重點

Claude Opus 4.8 已經上線,價格維持不變。官方同時強調了幾項配套變化:

  • Opus 4.8 在程式碼、代理能力、推理和知識工作評測上,相比前代繼續提升。
  • claude.ai 使用者可以控制 Claude 在任務上投入的 effort。
  • Claude Code 新增 dynamic workflows,用來處理更大規模的問題。
  • Opus 4.8 的 fast mode 可以以約 2.5 倍速度工作,並且比此前模型的 fast mode 便宜三倍。

把這些變化放在一起看,Anthropic 不是只在模型分數上做小幅升級,而是在圍繞「長時間執行複雜任務」改造產品形態。模型更強只是其中一部分,任務控制、工作流拆解和成本結構同樣重要。

為什麼 Claude Code 使用者更應該關注

Claude Code 這類程式設計 agent 最怕的不是單個函式不會寫,而是在真實倉庫裡迷路。它需要讀檔、理解依賴、跑測試、看錯誤、修改方案,再把修改控制在合理範圍內。

Opus 4.8 的賣點正好貼近這些問題:

  1. 更適合 agentic tasks,也就是需要模型持續規劃、呼叫工具、觀察結果並調整策略的任務。
  2. 更強調 judgement,能在不確定時停下來確認,而不是一路自信地寫錯。
  3. dynamic workflows 讓 Claude Code 更適合處理大規模、多步驟的問題。

如果這些能力在真實專案裡穩定,Claude Code 的使用方式會更接近「把一個明確目標交給它推進」,而不是只讓它補一段程式碼。

effort 控制意味著什麼

Anthropic 這次給 claude.ai 加入 effort 控制,含義很直接:使用者可以調節模型在任務上花多少力氣。

這對日常使用很實用。簡單問題不需要深推理,複雜任務則值得讓模型多想一會兒。過去很多使用者只能靠提示詞表達「認真一點」或「快速回答」,現在這種控制開始進入產品層。

對開發者來說,這也是一個信號:未來 agent 產品不會只暴露「選哪個模型」,還會暴露更多執行策略,比如速度、成本、推理深度、工具呼叫積極程度和風險偏好。

fast mode 的成本變化很關鍵

官方提到,Opus 4.8 的 fast mode 可以達到約 2.5 倍速度,同時成本比此前模型的 fast mode 低很多。

這件事容易被模型能力新聞蓋過去,但它對實際工作流很重要。很多 agent 任務不是只跑一次,而是會反覆執行:

  • 產生初稿
  • 跑測試
  • 修復失敗
  • 再跑測試
  • 根據 review 繼續修改

如果 fast mode 足夠便宜,團隊就更願意把它放進高頻流程裡,而不是只在關鍵任務上偶爾使用頂級模型。速度和成本一旦下降,agent 才更容易從「展示效果」進入「日常工具」。

和 Opus 4.7 的關係

Opus 4.8 更像是一次面向可用性的增強版。它繼承 Opus 4.7 的定位,但把重點繼續推向程式設計、代理任務和專業工作。

從 Anthropic 的表述看,Opus 4.8 不只是回答更好,而是更會協作。它在任務中應該更清楚什麼時候需要資訊、什麼時候方案不穩、什麼時候應該先建立信心再做大改動。

這類能力很難只靠單一 benchmark 判斷。真正的驗證要看它在大型倉庫、複雜業務規則、長上下文任務和多輪修復裡的表現。

對 AI 編程競爭的影響

2026 年的模型競爭已經明顯從「聊天能力」轉向「能不能做事」。OpenAI、Anthropic、Google、xAI 都在把模型和工具鏈綁得更緊:模型負責推理,工具負責執行,產品層負責把任務保持在可控範圍內。

Claude Opus 4.8 的發布延續了這個趨勢。它的重點不是炫耀一個單點能力,而是強化三個環節:

  • 模型本身更適合程式碼和代理任務。
  • Claude Code 能拆更大的工作流。
  • 產品層開始提供 effort 和 fast mode 這類執行控制。

這對開發者的實際意義是,選擇模型時不能只看「哪個最聰明」。還要看它是否適合所在工具、能否穩定呼叫工具、長任務成本是否可接受、失敗時是否容易被糾正。

Sonnet 5:最適合日常預設的模型

Claude Sonnet 5 是當前最值得關注的預設候選。它的定位是 best combination of speed and intelligence,也就是速度和智能的平衡點。

它適合:

  • 日常編碼和程式碼審查。
  • 文件整理、研究助理、知識工作。
  • 中等複雜度 Agent。
  • 企業內部自動化流程。
  • 需要控制成本但又不能犧牲太多品質的 API 應用。

Sonnet 5 的最大變化,是把許多過去更接近 Opus 級別的 Agent 能力下放到 Sonnet 價格區間。它同樣支援 1M token 上下文和 128k token 最大輸出,延遲比 Opus 更快。

價格方面,Sonnet 5 到 2026 年 8 月 31 日前有首發優惠:輸入 $2 / MTok,輸出 $10 / MTok。2026 年 9 月 1 日起恢復到標準價格:輸入 $3 / MTok,輸出 $15 / MTok。即便按標準價,它仍然明顯低於 Opus 4.8。

如果要給大多數團隊一個起點,我會把 Sonnet 5 放在第一位:先用它覆蓋 70% 到 80% 的任務,再把真正困難的任務升級到 Opus 4.8 或 Fable 5。

可用範圍與價格

Claude Sonnet 5 已面向所有 Claude 方案開放:

  • Free 和 Pro 使用者預設使用 Sonnet 5。
  • Max、Team 和 Enterprise 使用者可以使用 Sonnet 5。
  • Claude Code 和 Claude Platform 已支援 Sonnet 5。
  • 開發者可在 Claude API 中使用模型名 claude-sonnet-5

API 價格採用先低後高的過渡安排:

時間 輸入價格 輸出價格
2026 年 8 月 31 日前 2 美元 / 百萬 token 10 美元 / 百萬 token
之後標準價格 3 美元 / 百萬 token 15 美元 / 百萬 token

Anthropic 還表示,Sonnet 5 使用更新後的 tokenizer。相同輸入在新 tokenizer 下可能映射為更多 token,大約是原來的 1.0 到 1.35 倍,取決於內容類型。首發優惠價的一個目的,就是讓從 Sonnet 4.6 遷移過來的成本變化更平滑。

重點提升:讓 Sonnet 更像可用的執行層

Sonnet 5 的關鍵字是 Agent。Anthropic 強調,它能制定計畫、使用瀏覽器和終端等工具,並在更長的任務鏈條中持續執行。

這對開發者和企業使用者的意義很明確:

  1. 編碼任務不只停留在補全片段,而是更適合處理多步驟修改、除錯和驗證。
  2. 工具調用更穩定,適合接入瀏覽器、終端、企業應用和內部工作流。
  3. 在中等 effort 下,Sonnet 5 提供更好的性價比;在更高 effort 下,部分任務可以接近 Opus 4.8。
  4. 對 Claude Code 使用者來說,它更像日常可用的執行模型,而不是只在少數高難任務才啟用的昂貴模型。

Anthropic 引用了早期合作夥伴的回饋:Sonnet 5 在複雜程式碼庫、棕地專案、保險流程、法律研究和資料分析等任務中,能更完整地跟進任務,而不是中途停下或只給出建議。

安全評估:更安全,但不是無風險

Anthropic 的安全評估有兩個方向。

一方面,Sonnet 5 相比 Sonnet 4.6 表現更穩。它在 Agent 安全、拒絕惡意請求、抵抗提示注入、減少幻覺和降低迎合方面都有改進。Anthropic 的自動行為審計也顯示,Sonnet 5 的不良行為率低於 Sonnet 4.6。

另一方面,它並不比更強的 Opus 4.8 或 Mythos Preview 更穩。在同類安全評估中,Sonnet 5 的不良行為率仍高於這兩個模型。

網路安全能力方面,Anthropic 表示沒有刻意用網路安全任務訓練 Sonnet 5。它可以完成一些常規、無害的安全任務,但在潛在危險能力評估中,明顯弱於 Opus 4.8 和 Mythos 5。原文提到,在 Firefox 漏洞利用評估中,Sonnet 5 沒有成功生成完整可用的 exploit,但相對 Sonnet 4.6 有更高的部分成功率。

因此,Sonnet 5 預設啟用網路安全防護。這些防護用於即時偵測和阻止危險網路安全用途,強度與 Claude Opus 4.7、Opus 4.8 類似,但低於 Fable 5 上更嚴格的防護。

遷移時要注意什麼

如果你已經在用 Claude API 或 Claude Code,可以把 Sonnet 5 看成 Sonnet 4.6 的直接升級候選,但遷移前建議留意三件事。

第一,模型名需要改為:

1
claude-sonnet-5

第二,成本不能只看單價。Sonnet 5 的標準單價高於首發優惠價,且 tokenizer 變化可能讓部分輸入消耗更多 token。對長上下文、日誌分析、程式碼庫掃描這類任務,最好用自己的真實請求重新估算一次。

第三,effort 設定會影響性價比。Sonnet 5 的優勢之一,是可以在不同 effort 下覆蓋更寬的成本和能力區間。日常編碼、文件整理、輕量 Agent 任務未必需要直接拉到最高 effort;真正需要長時間規劃和多工具協作時,再提高 effort 更合理。

它和 Opus 4.8 的關係

Sonnet 5 並不是取代 Opus 4.8。更準確地說,它把一部分原本更接近 Opus 的 Agent 能力下放到了 Sonnet 級別。

如果任務追求最高上限,尤其是複雜研究、深度推理、長鏈路 Agent 和高難編碼,Opus 4.8 仍然有位置。如果任務更看重日常吞吐、價格和穩定執行,Sonnet 5 會更適合作為預設模型。

這也是這次發布最值得關注的地方:Sonnet 系列不再只是「夠快、夠便宜」的中階模型,而是開始承擔大量實際執行型工作。對企業和開發者來說,模型選擇可能會從「預設 Opus,嫌貴再降級」,變成「預設 Sonnet 5,必要時升級 Opus」。

實際遷移指南:先用任務分層測試

如果團隊已經在用 Sonnet 4.6,不建議一發布就把所有調用切到 Sonnet 5。更穩的做法,是先把任務按難度和風險分層:輕量問答、摘要、程式碼解釋、單檔修改、多檔重構、長流程 Agent、帶工具調用的自動化任務,分別準備一組樣本。

第一輪測試重點看完成率和返工率,而不是只看回答是否更「聰明」。例如 Claude Code 場景裡,可以比較它是否更少漏改測試、是否能更穩定地讀懂倉庫結構、是否會在不確定時停下來提問。

第二輪再看成本。Sonnet 5 的 tokenizer 變化可能讓同一段輸入產生更多 token,所以要用真實日誌測算,不要只按標價心算。尤其是長上下文、文件分析和程式碼庫任務,token 變化會直接影響帳單。

第三輪才決定預設模型。我的建議是:把 Sonnet 5 先設為日常 Agent 和編碼任務候選,把 Opus/Fable 留給失敗重試或高價值任務,把 Haiku 留給批量輕任務。這樣遷移更平滑,也更容易發現真正提升的環節。

觀察指標

試用 Sonnet 5 時,可以記錄四個指標:任務一次完成率、人工修改時間、工具調用失敗率、單位任務成本。只看 benchmark 很容易誤判,因為團隊裡的真實任務通常混合了程式碼、文件、環境、權限和上下文記憶。

如果某類任務 Sonnet 5 比舊模型更穩定,就值得優先遷移;如果只是回答更長但改動更冒進,那就應該繼續保留人工確認或改用更保守的提示詞。

原文:Introducing Claude Sonnet 5

Haiku 4.5:高吞吐、低延遲、低成本

Claude Haiku 4.5 是當前 Claude 主線裡最快的模型,官方定位是 fastest model with near-frontier intelligence。

它適合:

  • 分類、抽取、摘要、格式轉換。
  • 批量處理短文本。
  • 客服、工單、內容審核等高吞吐場景。
  • 對延遲非常敏感的互動式產品。
  • 不需要 1M 上下文的輕量任務。

它的限制也很清楚:上下文是 200k tokens,最大輸出是 64k tokens,低於 Fable、Opus 和 Sonnet 的 1M / 128k。對長程式碼庫、複雜多文檔分析、長流程 Agent 來說,Haiku 4.5 不應該是首選。

但如果任務是「量大、簡單、需要快」,Haiku 4.5 的性價比非常直接:輸入 $1 / MTok,輸出 $5 / MTok。

Mythos 5:不要當成普通可選項

Claude Mythos 5 和 Fable 5 共享規格與價格,但它不是通用可用模型。Anthropic 文件把它標為 limited availability,僅面向 Project Glasswing 中獲批客戶。

換句話說,如果你只是做常規 API 選型,通常不需要把 Mythos 5 放進候選列表。除非你已經是獲批客戶,或者透過 Anthropic、AWS、Google Cloud 等帳號團隊取得訪問權限,否則它不是一個可以直接替換 Fable 5 的模型。

從 Claude Opus 4.8 遷移到 Opus 5

不要只把模型字串替換後立即全量上線。更穩健的遷移流程如下。

第一步:固定真實測試集

從生產日誌中選取 30 至 100 個已減敏任務,覆蓋:

  • 正常成功案例;
  • 曾經需要重試的案例;
  • 工具呼叫失敗案例;
  • 長上下文和高輸出任務;
  • 可能觸發安全分類器的合法任務。

測驗集應保留預期結果或人工評分標準,否則只能比較文風,無法比較任務成功率。

第二步:只修改模型 ID

先保持提示字、工具定義、最大輸出長度和逾時不變,把模型切換為:

1
claude-opus-5

這樣可以把模型變化與其他配置變化分開。若同時重寫提示詞和工具 schema,出現迴歸時很難定位原因。

第三步:比較四類指標

至少比較:

  1. 最終任務成功率;
  2. 輸入、輸出和總 token;
  3. P50、P95 端對端延遲;
  4. 每個成功任務的實際成本。

代理任務也應單獨記錄工具呼叫次數、無效循環次數和人工接管率。

第四步:重新校準提示詞

Opus 5 較主動,舊提示詞中大量「請繼續檢查」「請自行驗證」的重複指示可能不再必要。可以逐步刪除冗餘要求,但必須保留業務邊界,例如:

  • 未經批准不得部署;
  • 不得刪除生產數據;
  • 修改前先輸出證據;
  • 密鑰和個人資訊不得進入日誌;
  • 高風險操作必須等待人工確認。

主動性增強不等於授權範圍擴大。

第五步:灰階發布並保留回退

先將少量流量切到 Opus 5,再逐步擴大。回退條件可以包括:

  • 錯誤率超過閾值;
  • P95 延遲明顯惡化;
  • 單任務成本超出預算;
  • 工具呼叫出現重複循環;
  • 安全分類器回退比例異常上升。

回退策略本身也要測試,不能等生產請求觸發後才確認日誌和回應格式是否相容。

兩項 API Beta 更新

Anthropic 同時介紹了兩項與 Opus 5 配合的 API Beta 能力。

對話中途修改工具

應用程式可以在對話進行過程中更改可用工具,而不會讓提示快取失效。這對長時間運行的代理很有用:系統可以按任務階段載入資料庫、瀏覽器或部署工具,不必從一開始就把所有工具定義塞進上下文。

潛在收益包括:

  • 減少無關工具對模型選擇的干擾;
  • 保留提示緩存,降低重複上下文成本;
  • 依據權限和任務狀態動態開放工具;
  • 縮小高風險工具的暴露時間視窗。

分類器觸發後的自動模型回退

API 可以在安全分類器標記請求後自動切換到另一個模型。預設設定會選擇目前可用的最佳替代模型,也可以根據業務需求配置回退策略。

接取該功能時,應將「實際回應模型」納入可觀測性。否則應用程式看到請求成功,卻不知道同一測試集為何出現輸出風格、延遲或能力差異。

安全機制會如何影響開發者?

Anthropic 表示,Opus 5 在自動化對齊稽核中的整體不當行為得分為 2.3,是近期模型中最低的。同時,官方認為它沒有推進高風險雙用途能力的前沿,在生物和進攻性網路安全方面落後於 Mythos 5。

網路安全場景的邊界尤其值得注意:

  • 原始碼漏洞發現可以被允許;
  • 二進位漏洞掃描、滲透測試和漏洞利用產生可能被阻止;
  • Opus 5 的漏洞發現能力有所提高,但漏洞利用開發仍明顯落後於 Mythos 5;
  • 新分類器預計比 Fable 5 減少約 85% 的干預。

在 Claude.ai、Claude Code 和 Cowork 中,被標記的請求預設會回退到 Opus 4.8。 API 使用者也可以啟用回退。 Claude Verified Participants 計劃中的用戶可以在更少限制下存取相關能力。

對普通開發團隊而言,最重要的不是嘗試繞過分類器,而是區分合法的防禦性任務,並為被阻止或回退的請求提供明確的使用者提示和人工處理路徑。

Claude Pro、Max、Claude Code 和 API 怎麼選?

使用方式 適合人群 Opus 5 的位置
Claude Pro 個人日常研究、寫作和開發 官方稱其為 Pro 中最強模型
Claude Max 高頻專業用戶 Opus 5 已是預設模型
Claude Code 終端內編碼與代理任務 可直接用於編程工作流程,Fast Mode 可透過 usage credits 使用
Claude API 產品整合、批次和自建代理 使用 claude-opus-5,可自行控制流量、預算和回退

如果只是評估輸出質量,可以先在 Claude 應用程式中建立測試範例;如果要測量 token、工具呼叫、錯誤率和成本,則應使用 API 或現有的工程評測架構。

上線前檢查清單

  • 模型 ID 已改為 claude-opus-5,且沒有誤改其他環境;
  • API Key 透過環境變數或金鑰管理服務提供;
  • 使用真實、減敏的生產任務建立回歸測試集;
  • 記錄輸入輸出 token、延遲、工具呼叫和成功率;
  • 以「每個成功任務」比較成本,而不只比較單價;
  • Fast Mode 有獨立預算與監控;
  • effort 從低或中等設定開始,依失敗條件升級;
  • 高風險工具仍受權限及人工確認控制;
  • 自動模型回退在日誌中可見;
  • 灰階發布期間保留 Opus 4.8 回退路徑。

Opus 5:API、Fast Mode 與遷移

Claude Opus 5 的產品定位

Anthropic 在發布說明中把 Opus 5 描述為一款更「周到且主動」的模型。這裡的主動並不是未經允許執行危險操作,而是面對開放式任務時,能夠補齊必要步驟、創建測試工具並檢查自己的結果。

官方給出的幾個案例很能說明這種變化:

  • 在 FreeCAD 中完成電腦視覺管線,而不是只產生一段孤立程式碼;
  • 定位一個套件管理器問題的根本原因,而不是停留在表面報錯;
  • 建立交易市場資料來源,並自行建立測試工具驗證行為。

這類任務有一個共同點:使用者給的目標通常不完整,模型必須在多個步驟之間保持狀態,也要判斷何時需要驗證。對 Claude Code、內部研發代理商和桌面自動化而言,這比單輪問答分數更有參考價值。

與 Opus 4.8、Fable 5、Mythos 5 怎麼比較?

根據 Anthropic 的官方定位,可以做如下理解:

模型 更適合的定位 官方比較中的關鍵資訊
Claude Opus 4.8 已穩定運作的現有 Opus 工作負載 Opus 5 保持相同基礎單價,並在多項能力上提升
Claude Opus 5 高難度通用代理、編程、科研和工具操作 接近 Fable 5 的前沿智能,價格約為其一半
Claude Fable 5 追求最高能力上限的任務 CursorBench 3.2 中仍保持極小領先,但任務成本更高
Claude Mythos 5 更偏前沿網路安全能力 官方明確表示 Opus 5 在網路安全方面落後於 Mythos 5

這張表不能取代你自己的測試。尤其是「接近」「領先」等結論都依賴特定基準、努力等級和工具環境,不能直接等同於所有業務場景中的效果。

官方公佈了哪些效能提升?

Anthropic 公佈的結果主要涵蓋代理任務、程式設計、電腦操作、科學研究和視覺輸出。

1. 代理與真實工作任務

在 Frontier-Bench v0.1 上,Opus 5 的表現超過 Opus 4.8 的兩倍,同時每個任務的成本更低。 Anthropic 也表示,Opus 5 在 Frontier-Bench 和 GDPval-AA 上達到新的最佳成績。

這些基準更著重於完成整個任務,而不是回答一道靜態題目,因此對代理類應用有一定參考價值。但生產環境也應記錄失敗後的重試次數,因為一次運行價格較高、卻能減少兩次重試的模型,最終可能更便宜。

2. 程式設計與工具使用

在 CursorBench 3.2 的最高努力設定下,Opus 5 距離 Fable 5 的最佳成績只有 0.5%,每個任務的成本則約為後者的一半。

官方也強調了模型對複雜工具鏈的處理能力。遷移 Claude Code 工作流程時,建議專注於測試以下類型的任務:

  • 跨多個文件追蹤 bug;
  • 讀取日誌後定位根因並補充測試;
  • 修改程式碼後執行建置、測試和格式檢查;
  • 在需求不完整時識別約束,而不是過早提交實現;
  • 需要連續呼叫多個 MCP 工具的操作流程。

3. 電腦操作與自動化

在 OSWorld 2.0 中,Opus 5 在相近成本下超過其他模型;官方稱它以略高於 Fable 5 三分之一的成本,超過了後者的最佳成績。

在 Zapier AutomationBench 上,Opus 5 的得分約為同等任務成本下次優模型的 1.5 倍。即使採用最低努力等級,它仍完成了最多任務。

這意味著低努力等級不一定只適合簡單聊天。對於結構明確的自動化任務,它可能成為控制 token 和延遲的實用選擇。

4. 科學研究與視覺任務

Anthropic 表示,Opus 5 在所有生命科學評測上都優於 Opus 4.8。其中內部有機化學評測提高 10.2 個百分點,蛋白質變異評測提高 7.7 個百分點。

此外,模型產生的網頁、幻燈片和其他視覺成果也有所改進。不過這些仍然是發布者提供的評測和範例。涉及科學研究結論、醫療資訊或實驗​​設計時,必須保留人工複查和來源驗證,不能把更高基準分數當作事實正確性的保證。

Claude Opus 5 API 價格

Opus 5 的基礎 API 價格如下:

項目 價格
輸入 token 5 美元 / 100 萬 token
輸出 token 25 美元 / 100 萬 token
Fast Mode 基本費率的 2 倍

以上是發布說明中所給的基礎價格。提示快取、批次或雲端平台頻道可能採用不同計費規則,正式預算仍應以呼叫頻道當時的帳單說明為準。

一次要求大約多少錢?

假設一個長任務累計使用:

  • 輸入 100 萬 token;
  • 輸出 20 萬 token。

預設模式的基礎費用為:

1
2
3
输入:1 × 5 美元 = 5 美元
输出:0.2 × 25 美元 = 5 美元
合计:10 美元

如果相同 token 用量全部以 Fast Mode 的兩倍費率計算,則約為 20 美元。

真實代理任務不能只按單次呼叫估算。更有用的指標是「每個成功任務成本」:

1
每个成功任务成本 = 总调用费用 ÷ 最终成功完成的任务数

一個便宜模型如果頻繁重試、需要人工接管,最終成本可能比 Opus 5 更高;反過來,簡單任務使用 Opus 5 也可能沒有足夠收益。

使用 API 呼叫 Claude Opus 5

curl 範例

先把 API Key 放入環境變量,再呼叫 Messages API。不要把真實密鑰寫進腳本或提交到 Git 倉庫。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
export ANTHROPIC_API_KEY="your-api-key"

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "messages": [
      {
        "role": "user",
        "content": "分析这个服务的错误日志,给出根因、验证步骤和最小修复方案。"
      }
    ]
  }'

Windows PowerShell 中可以先設定目前會話環境變數:

1
$env:ANTHROPIC_API_KEY = "your-api-key"

然後使用 Anthropic SDK,或按照當前官方文件構造請求。環境變數只對目前 PowerShell 會話生效,更適合臨時測試。

Python SDK 範例

安裝 SDK:

1
python -m pip install -U anthropic

建立最小呼叫腳本:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
from anthropic import Anthropic

client = Anthropic()

message = client.messages.create(
    model="claude-opus-5",
    max_tokens=1024,
    messages=[
        {
            "role": "user",
            "content": (
                "检查下面的部署故障。先列假设,再给验证命令;"
                "没有证据时不要直接修改配置。"
            ),
        }
    ],
)

print(message.content[0].text)
print(message.usage)

生產環境至少應額外記錄:

  • 請求使用的模型 ID;
  • 輸入與輸出 token;
  • 總耗時且首 token 延遲;
  • 工具呼叫次數與失敗原因;
  • 是否發生模型回退;
  • 最終任務是否由人工接手。

只記錄 HTTP 200 並不足以衡量代理任務是否成功。

Fast Mode 適合什麼場景?

Opus 5 的 Fast Mode 速度約為預設模式的 2.5 倍,價格則為基礎費率的 2 倍。 Claude Platform 可以使用該模式,Claude Code 也可透過 usage credits 使用。

適合優先測試 Fast Mode 的場景包括:

  • 開發者正在等待的互動式 Claude Code 會話;
  • 需要快速迭代的線上事故分析;
  • 演示、結對程式設計和即時工具操作;
  • 延遲對業務價值的影響高於單次 token 成本的流程。

不適合預設開啟的場景包括:

  • 夜間批次處理;
  • 可以排隊運行的離線程式碼審查;
  • 大規模低優先級資料整理;
  • 尚未建立費用上限和監控的代理商循環。

建議為 Fast Mode 設定獨立預算標籤,並比較 P50、P95 延遲和每個成功任務成本。光是看到「快 2.5 倍」就給所有請求開啟,通常無法得到最優成本結構。

Effort 設定如何使用?

Opus 5 提供不同 effort 設置,用於在智慧等級、token 用量、延遲與成本之間取捨。 Anthropic 的發布數據表明,低 effort 在部分自動化基準中仍具有競爭力,而最高 effort 更適合逼近模型能力上限。

可以採用分層策略:

任務 建議起點 升級條件
格式轉換、固​​定規則抽取 低 effort 格式錯誤或遺漏率超標
常規編碼、單一倉庫排錯 中 effort 多次工具呼叫後仍無法定位
跨系統故障、架構設計 高 effort 任務價值足以涵蓋額外 token
前沿研究或高難度代理評測 最高 effort 需要驗證能力上限

具體參數名稱和可用範圍可能隨 SDK 或平台更新,不應憑發布稿猜測請求欄位。存取時應以所用 API 版本的官方文件為準。

怎麼選:按任務複雜度分層

可以按下面這個順序選:

  1. 預設先試 Sonnet 5
    適合大多數編碼、文件、Agent、企業自動化任務。

  2. 任務明顯複雜時升到 Opus 4.8
    例如長程式碼庫、多工具、多步驟、需要穩定執行和較強推理的場景。

  3. 追求最高能力時試 Fable 5
    適合高價值、長流程、失敗成本高、對價格不那麼敏感的任務。

  4. 高吞吐輕任務用 Haiku 4.5
    適合分類、抽取、摘要、客服、批處理和低延遲互動。

  5. Mythos 5 只在有權限時考慮
    它不是普通開發者預設可選項。

遷移和成本上的兩個細節

第一,較新的 Claude 模型使用了新 tokenizer。Anthropic 文件說明,Opus 4.7 及之後的 Opus、Fable 5、Mythos 5、Mythos Preview 和 Sonnet 5 的 tokenizer 會讓相同文本大約多出 30% token。做成本估算時,不能只看每百萬 token 單價。

第二,1M 上下文不等於每次都應該塞滿上下文。Fable 5、Opus 4.8、Sonnet 5 都支援 1M token,上下文很大,但工具調用、快取、輸出和多輪 Agent 都會疊加成本。實際部署時,更好的做法是:

  • 常用系統提示和長背景用 prompt caching。
  • 長文檔先分塊抽取,再交給高能力模型做綜合判斷。
  • 簡單步驟交給 Haiku 或 Sonnet,關鍵決策再升級 Opus / Fable。
  • 用真實任務跑小樣本,而不是只看官方 benchmark。

一個簡單結論

Claude 當前的模型線已經很清楚:

  • Fable 5:最高能力,適合最難和最高價值任務。
  • Opus 4.8:複雜 Agent 編碼和企業任務的強力選擇。
  • Sonnet 5:最適合日常預設,能力、速度和價格平衡。
  • Haiku 4.5:最快最便宜,適合大規模輕任務。
  • Mythos 5:受限可用,不當作常規選項。

如果你正在給產品或內部工作流選 Claude 模型,最實用的策略不是直接追最高檔,而是把任務分層:Haiku 處理輕量批量任務,Sonnet 5 做預設執行層,Opus 4.8 處理複雜 Agent 和高難編碼,Fable 5 留給最難、最貴、最值得的那一小部分任務。

模型路由建議

給 Claude 模型做選型時,最好不要只做「一個預設模型」。更實用的方式是設計一套路由規則:輕量批處理走 Haiku,日常編碼和知識工作走 Sonnet,複雜倉庫任務和多步驟 Agent 走 Opus,最高價值、最高難度任務再升級到 Fable。

路由規則可以先簡單一點。例如摘要、分類、欄位抽取優先 Haiku;PR review、文件生成、普通程式碼修改優先 Sonnet;跨模組重構、事故復盤、複雜規劃優先 Opus;如果 Opus 連續失敗或任務價值很高,再交給 Fable。

還要給每一檔設定退出條件。模型輸出不確定、工具調用失敗、測試連續不過、上下文超過閾值、任務涉及權限或生產資料時,都應該觸發人工確認,而不是繼續自動推進。

成本評估方法

模型價格表只能做粗算。真實成本取決於上下文長度、快取命中率、重試次數、輸出長度和人工返工時間。一個更貴的模型如果一次完成率高,可能比便宜模型多次重試更省。

建議為每類任務記錄三項資料:平均 token 成本、平均人工驗收時間、失敗後升級模型的比例。跑兩週之後,通常就能看出哪些任務該放在 Sonnet,哪些任務值得上 Opus 或 Fable。

參考資料: