Anthropic 当前的 Claude 模型线已经不再只是“Haiku 快、Sonnet 均衡、Opus 最强”这么简单。到 2026 年 7 月,官方主推的几类模型包括 Claude Fable 5、Claude Opus 4.8、Claude Sonnet 5、Claude Haiku 4.5,以及受限开放的 Claude Mythos 5。
如果只想快速选型,可以先记住一句话:日常开发和多数 Agent 任务优先试 Sonnet 5;复杂企业级 Agent 和高难编码用 Opus 4.8;追求最高能力再看 Fable 5;低延迟和成本敏感任务用 Haiku 4.5;Mythos 5 不是通用产品,只面向批准客户。
当前主要模型一览
| 模型 | API ID / alias | 定位 | 上下文 | 最大输出 | 延迟倾向 | 标准价格 |
|---|---|---|---|---|---|---|
| Claude Fable 5 | claude-fable-5 |
Anthropic 当前广泛发布模型里的最高能力档,适合长流程 Agent | 1M tokens | 128k tokens | 较慢 | 输入 $10 / MTok,输出 $50 / MTok |
| Claude Opus 4.8 | claude-opus-4-8 |
复杂 Agent 编码、企业工作流、浏览器/电脑使用 | 1M tokens | 128k tokens | 中等 | 输入 $5 / MTok,输出 $25 / MTok |
| Claude Sonnet 5 | claude-sonnet-5 |
速度、能力和价格最均衡,适合作默认模型 | 1M tokens | 128k tokens | 快 | 2026-08-31 前输入 $2 / MTok,输出 $10 / MTok;之后 $3 / $15 |
| Claude Haiku 4.5 | claude-haiku-4-5 |
最快、成本最低,适合高吞吐轻任务 | 200k tokens | 64k tokens | 最快 | 输入 $1 / MTok,输出 $5 / MTok |
| Claude Mythos 5 | claude-mythos-5 |
与 Fable 5 同规格同价格,但受限开放 | 1M tokens | 128k tokens | 较慢 | 输入 $10 / MTok,输出 $50 / MTok |
这里的 MTok 指 million tokens,也就是百万 token。价格还会受 prompt caching、batch、数据驻留、云平台区域等因素影响,表格只放最常用的基础输入/输出价格。
Fable 5:最高能力,但不是默认首选
Claude Fable 5 是 Anthropic 当前“广泛发布”模型里能力最高的一档。官方给它的定位是 next-generation intelligence for long-running agents,也就是面向长流程 Agent 的下一代高能力模型。
它适合这些场景:
- 长时间、多步骤、需要自主推进的 Agent 工作流。
- 复杂研究、复杂代码迁移、跨系统规划。
- 需要最高推理能力和大上下文的企业任务。
- 不太敏感于成本和延迟的高价值任务。
但 Fable 5 不一定适合作为默认模型。它价格最高,延迟也更慢。除非任务确实需要最高能力,否则从 Sonnet 5 或 Opus 4.8 开始测试通常更稳。
还要注意一点:Fable 5 使用 adaptive thinking,而且是 always on。这意味着它会自动决定什么时候推理、推理多少;这对复杂任务有帮助,但也会让成本和响应时间更依赖任务本身。
Opus 4.8:复杂编码和企业 Agent 的稳妥选择
Claude Opus 4.8 处在 Fable 5 和 Sonnet 5 之间。官方建议,如果不确定复杂 Agent 编码和企业工作该用什么模型,可以从 Opus 4.8 开始。
它的优势是:
- 1M token 上下文。
- 128k token 最大输出。
- 复杂编码、浏览器 Agent、电脑使用和企业工作流表现强。
- 价格只有 Fable 5 的一半。
- 支持 adaptive thinking。
Opus 4.8 适合放在“高难任务默认模型”的位置。比如代码库级重构、复杂 PR 修复、企业数据分析、多工具 Agent、长文档推理等,都可以先用 Opus 4.8 做基准。
如果任务非常难,Opus 4.8 不够,再升级 Fable 5;如果任务量很大、成本压力明显,再下放到 Sonnet 5。
这次更新的重点
Claude Opus 4.8 已经上线,价格保持不变。官方同时强调了几项配套变化:
- Opus 4.8 在代码、代理能力、推理和知识工作评测上相比前代继续提升。
claude.ai用户可以控制 Claude 在任务上投入的 effort。- Claude Code 新增 dynamic workflows,用来处理更大规模的问题。
- Opus 4.8 的 fast mode 可以以约 2.5 倍速度工作,并且比此前模型的 fast mode 便宜三倍。
这些变化放在一起看,Anthropic 不是只在模型分数上做小幅升级,而是在围绕“长时间执行复杂任务”改产品形态。模型更强只是其中一部分,任务控制、工作流拆解和成本结构同样重要。
为什么 Claude Code 用户更应该关注
Claude Code 这类编程 agent 最怕的不是单个函数不会写,而是在真实仓库里迷路。它需要读文件、理解依赖、跑测试、看错误、修改方案,再把修改控制在合理范围内。
Opus 4.8 的卖点正好贴近这些问题:
- 更适合 agentic tasks,也就是需要模型持续计划、调用工具、观察结果并调整策略的任务。
- 更强调 judgement,能在不确定时停下来确认,而不是一路自信地写错。
- dynamic workflows 让 Claude Code 更适合处理大规模、多步骤的问题。
如果这些能力在真实项目里稳定,Claude Code 的使用方式会更接近“把一个明确目标交给它推进”,而不是只让它补一段代码。
effort 控制意味着什么
Anthropic 这次给 claude.ai 加入 effort 控制,含义很直接:用户可以调节模型在任务上花多少力气。
这对日常使用很实用。简单问题不需要深推理,复杂任务则值得让模型多想一会儿。过去很多用户只能靠提示词表达“认真一点”或“快速回答”,现在这种控制开始进入产品层。
对开发者来说,这也是一个信号:未来 agent 产品不会只暴露“选哪个模型”,还会暴露更多执行策略,比如速度、成本、推理深度、工具调用积极程度和风险偏好。
fast mode 的成本变化很关键
官方提到,Opus 4.8 的 fast mode 可以达到约 2.5 倍速度,同时成本比此前模型的 fast mode 低很多。
这件事容易被模型能力新闻盖过去,但它对实际工作流很重要。很多 agent 任务不是只跑一次,而是会反复执行:
- 生成初稿
- 跑测试
- 修复失败
- 再跑测试
- 根据 review 继续改
如果 fast mode 足够便宜,团队就更愿意把它放进高频流程里,而不是只在关键任务上偶尔使用顶级模型。速度和成本一旦下降,agent 才更容易从“演示效果”进入“日常工具”。
和 Opus 4.7 的关系
Opus 4.8 更像是一次面向可用性的增强版。它继承 Opus 4.7 的定位,但把重点继续推向编程、代理任务和专业工作。
从 Anthropic 的表述看,Opus 4.8 不只是回答更好,而是更会协作。它在任务中应该更清楚什么时候需要信息、什么时候方案不稳、什么时候应该先建立信心再做大改动。
这类能力很难只靠单一 benchmark 判断。真正的验证要看它在大型仓库、复杂业务规则、长上下文任务和多轮修复里的表现。
对 AI 编程竞争的影响
2026 年的模型竞争已经明显从“聊天能力”转向“能不能做事”。OpenAI、Anthropic、Google、xAI 都在把模型和工具链绑得更紧:模型负责推理,工具负责执行,产品层负责把任务保持在可控范围内。
Claude Opus 4.8 的发布延续了这个趋势。它的重点不是炫耀一个单点能力,而是强化三个环节:
- 模型本身更适合代码和代理任务。
- Claude Code 能拆更大的工作流。
- 产品层开始提供 effort 和 fast mode 这类执行控制。
这对开发者的实际意义是,选择模型时不能只看“哪个最聪明”。还要看它是否适合所在工具、能否稳定调用工具、长任务成本是否可接受、失败时是否容易被纠正。
Sonnet 5:最适合日常默认的模型
Claude Sonnet 5 是当前最值得关注的默认候选。它的定位是 best combination of speed and intelligence,也就是速度和智能的平衡点。
它适合:
- 日常编码和代码审查。
- 文档整理、研究助理、知识工作。
- 中等复杂度 Agent。
- 企业内部自动化流程。
- 需要控制成本但又不能牺牲太多质量的 API 应用。
Sonnet 5 的最大变化,是把许多过去更接近 Opus 级别的 Agent 能力下放到 Sonnet 价格区间。它同样支持 1M token 上下文和 128k token 最大输出,延迟比 Opus 更快。
价格方面,Sonnet 5 到 2026 年 8 月 31 日前有首发优惠:输入 $2 / MTok,输出 $10 / MTok。2026 年 9 月 1 日起恢复到标准价格:输入 $3 / MTok,输出 $15 / MTok。即便按标准价,它仍然明显低于 Opus 4.8。
如果要给大多数团队一个起点,我会把 Sonnet 5 放在第一位:先用它覆盖 70% 到 80% 的任务,再把真正困难的任务升级到 Opus 4.8 或 Fable 5。
可用范围和价格
Claude Sonnet 5 已面向所有 Claude 计划开放:
- Free 和 Pro 用户默认使用 Sonnet 5。
- Max、Team 和 Enterprise 用户可以使用 Sonnet 5。
- Claude Code 和 Claude Platform 已支持 Sonnet 5。
- 开发者可在 Claude API 中使用模型名
claude-sonnet-5。
API 价格采用先低后高的过渡安排:
| 时间 | 输入价格 | 输出价格 |
|---|---|---|
| 2026 年 8 月 31 日前 | 2 美元 / 百万 token | 10 美元 / 百万 token |
| 之后标准价格 | 3 美元 / 百万 token | 15 美元 / 百万 token |
Anthropic 还表示,Sonnet 5 使用了更新后的 tokenizer。相同输入在新 tokenizer 下可能映射为更多 token,大约是原来的 1.0 到 1.35 倍,具体取决于内容类型。首发优惠价的一个目的,就是让从 Sonnet 4.6 迁移过来的成本变化更平滑。
重点提升:让 Sonnet 更像可用的执行层
Sonnet 5 的关键词是 Agent。Anthropic 强调,它能制定计划、使用浏览器和终端等工具,并在更长的任务链条里持续执行。
这对开发者和企业用户的意义比较明确:
- 编码任务不只停留在补全片段,而是更适合处理多步骤修改、调试和验证。
- 工具调用更稳定,适合接入浏览器、终端、企业应用和内部工作流。
- 在中等 effort 下,Sonnet 5 提供了更好的性价比;在更高 effort 下,部分任务可以接近 Opus 4.8。
- 对 Claude Code 用户来说,它更像一个日常可用的执行模型,而不是只在少数高难任务中才启用的昂贵模型。
Anthropic 引用了早期合作伙伴的反馈:Sonnet 5 在复杂代码库、棕地项目、保险流程、法律研究和数据分析等任务中,能更完整地跟进任务,而不是中途停下或只给出建议。
安全评估:更安全,但不是无风险
Anthropic 的安全评估给出了两个方向的结论。
一方面,Sonnet 5 相比 Sonnet 4.6 表现更稳。它在 Agent 安全、拒绝恶意请求、抵抗提示注入、减少幻觉和减少迎合方面都有改进。Anthropic 的自动行为审计也显示,Sonnet 5 的不良行为率低于 Sonnet 4.6。
另一方面,它并不比更强的 Opus 4.8 或 Mythos Preview 更稳。在同一类安全评估中,Sonnet 5 的不良行为率仍高于这两个模型。
网络安全能力方面,Anthropic 表示没有刻意用网络安全任务训练 Sonnet 5。它可以完成一些常规、无害的安全任务,但在潜在危险能力评估中,明显弱于 Opus 4.8 和 Mythos 5。原文提到,在 Firefox 漏洞利用评估中,Sonnet 5 没有成功生成完整可用的 exploit,但相对 Sonnet 4.6 有更高的部分成功率。
因此,Sonnet 5 默认启用了网络安全防护。这些防护用于实时检测和阻止危险网络安全用途,强度与 Claude Opus 4.7、Opus 4.8 类似,但低于 Fable 5 上更严格的防护。
迁移时要注意什么
如果你已经在用 Claude API 或 Claude Code,可以把 Sonnet 5 看成 Sonnet 4.6 的直接升级候选,但迁移前建议留意三件事。
第一,模型名需要改为:
|
|
第二,成本不能只看单价。Sonnet 5 的标准单价高于首发优惠价,且 tokenizer 变化可能让部分输入消耗更多 token。对长上下文、日志分析、代码库扫描这类任务,最好用自己的真实请求重新估算一次。
第三,effort 设置会影响性价比。Sonnet 5 的优势之一是可以在不同 effort 下覆盖更宽的成本和能力区间。日常编码、文档整理、轻量 Agent 任务未必需要直接拉到最高 effort;真正需要长时间规划和多工具协作时,再提高 effort 更合理。
它和 Opus 4.8 的关系
Sonnet 5 并不是取代 Opus 4.8。更准确地说,它把一部分原本更接近 Opus 的 Agent 能力下放到了 Sonnet 级别。
如果任务追求最高上限,尤其是复杂研究、深度推理、长链路 Agent 和高难编码,Opus 4.8 仍然有位置。如果任务更看重日常吞吐、价格和稳定执行,Sonnet 5 会更适合作为默认模型。
这也是这次发布最值得关注的地方:Sonnet 系列不再只是“够快、够便宜”的中档模型,而是开始承担大量实际执行型工作。对企业和开发者来说,模型选择可能会从“默认 Opus,嫌贵再降级”,变成“默认 Sonnet 5,必要时升级 Opus”。
实际迁移指南:先用任务分层测试
如果团队已经在用 Sonnet 4.6,不建议一发布就把所有调用切到 Sonnet 5。更稳的做法是先把任务按难度和风险分层:轻量问答、摘要、代码解释、单文件修改、多文件重构、长流程 Agent、带工具调用的自动化任务,分别准备一组样本。
第一轮测试重点看完成率和返工率,而不是只看回答是否更“聪明”。比如 Claude Code 场景里,可以比较它是否更少漏改测试、是否能更稳定地读懂仓库结构、是否会在不确定时停下来提问。
第二轮再看成本。Sonnet 5 的 tokenizer 变化可能让同一段输入产生更多 token,所以要用真实日志测算,不要只按标价心算。尤其是长上下文、文档分析和代码库任务,token 变化会直接影响账单。
第三轮才决定默认模型。我的建议是:把 Sonnet 5 先设为日常 Agent 和编码任务候选,把 Opus/Fable 留给失败重试或高价值任务,把 Haiku 留给批量轻任务。这样迁移更平滑,也更容易发现真正提升的环节。
观察指标
试用 Sonnet 5 时,可以记录四个指标:任务一次完成率、人工修改时间、工具调用失败率、单位任务成本。只看 benchmark 很容易误判,因为团队里的真实任务通常混合了代码、文档、环境、权限和上下文记忆。
如果某类任务 Sonnet 5 比旧模型更稳定,就值得优先迁移;如果只是回答更长但改动更冒进,那就应该继续保留人工确认或改用更保守的提示词。
原文:Introducing Claude Sonnet 5
Haiku 4.5:高吞吐、低延迟、低成本
Claude Haiku 4.5 是当前 Claude 主线里最快的模型,官方定位是 fastest model with near-frontier intelligence。
它适合:
- 分类、抽取、摘要、格式转换。
- 批量处理短文本。
- 客服、工单、内容审核等高吞吐场景。
- 对延迟非常敏感的交互式产品。
- 不需要 1M 上下文的轻量任务。
它的限制也很清楚:上下文是 200k tokens,最大输出是 64k tokens,低于 Fable、Opus 和 Sonnet 的 1M / 128k。对长代码库、复杂多文档分析、长流程 Agent 来说,Haiku 4.5 不应该是首选。
但如果任务是“量大、简单、需要快”,Haiku 4.5 的性价比非常直接:输入 $1 / MTok,输出 $5 / MTok。
Mythos 5:不要当成普通可选项
Claude Mythos 5 和 Fable 5 共享规格与价格,但它不是通用可用模型。Anthropic 文档把它标为 limited availability,仅面向 Project Glasswing 中获批客户。
换句话说,如果你只是做常规 API 选型,通常不需要把 Mythos 5 放进候选列表。除非你已经是获批客户,或者通过 Anthropic、AWS、Google Cloud 等账号团队获得访问权限,否则它不是一个可以直接替换 Fable 5 的模型。
从 Claude Opus 4.8 迁移到 Opus 5
不要只把模型字符串替换后立即全量上线。更稳妥的迁移流程如下。
第一步:固定真实测试集
从生产日志中选取 30 至 100 个已脱敏任务,覆盖:
- 正常成功案例;
- 曾经需要重试的案例;
- 工具调用失败案例;
- 长上下文和高输出任务;
- 可能触发安全分类器的合法任务。
测试集应保留预期结果或人工评分标准,否则只能比较文风,不能比较任务成功率。
第二步:只修改模型 ID
先保持提示词、工具定义、最大输出长度和超时不变,把模型切换为:
|
|
这样可以把模型变化与其他配置变化分开。若同时重写提示词和工具 schema,出现回归时很难定位原因。
第三步:比较四类指标
至少比较:
- 最终任务成功率;
- 输入、输出和总 token;
- P50、P95 端到端延迟;
- 每个成功任务的实际成本。
代理任务还应单独记录工具调用次数、无效循环次数和人工接管率。
第四步:重新校准提示词
Opus 5 更主动,旧提示词中大量“请继续检查”“请自行验证”的重复指令可能不再必要。可以逐步删除冗余要求,但必须保留业务边界,例如:
- 未经批准不得部署;
- 不得删除生产数据;
- 修改前先输出证据;
- 密钥和个人信息不得进入日志;
- 高风险操作必须等待人工确认。
主动性增强不等于授权范围扩大。
第五步:灰度发布并保留回退
先将少量流量切到 Opus 5,再逐步扩大。回退条件可以包括:
- 错误率超过阈值;
- P95 延迟明显恶化;
- 单任务成本超出预算;
- 工具调用出现重复循环;
- 安全分类器回退比例异常上升。
回退策略本身也要测试,不能等生产请求触发后才确认日志和响应格式是否兼容。
两项 API Beta 更新
Anthropic 同时介绍了两项与 Opus 5 配合的 API Beta 能力。
对话中途修改工具
应用可以在对话进行过程中更改可用工具,而不会让提示缓存失效。这对长时间运行的代理很有用:系统可以按任务阶段加载数据库、浏览器或部署工具,不必从一开始就把所有工具定义塞进上下文。
潜在收益包括:
- 减少无关工具对模型选择的干扰;
- 保留提示缓存,降低重复上下文成本;
- 根据权限和任务状态动态开放工具;
- 缩小高风险工具的暴露时间窗口。
分类器触发后的自动模型回退
API 可以在安全分类器标记请求后自动切换到另一个模型。默认设置会选择当前可用的最佳替代模型,也可以根据业务需要配置回退策略。
接入该功能时,应把“实际响应模型”纳入可观测性。否则应用看到请求成功,却不知道同一测试集为何出现输出风格、延迟或能力差异。
安全机制会怎样影响开发者?
Anthropic 表示,Opus 5 在自动化对齐审计中的总体不当行为得分为 2.3,是近期模型中最低的。同时,官方认为它没有推进高风险双用途能力的前沿,在生物和进攻性网络安全方面落后于 Mythos 5。
网络安全场景的边界尤其值得注意:
- 源代码漏洞发现可以被允许;
- 二进制漏洞扫描、渗透测试和漏洞利用生成可能被阻止;
- Opus 5 的漏洞发现能力有所提高,但漏洞利用开发仍明显落后于 Mythos 5;
- 新分类器预计比 Fable 5 减少约 85% 的干预。
在 Claude.ai、Claude Code 和 Cowork 中,被标记的请求默认会回退到 Opus 4.8。API 用户也可以启用回退。Claude Verified Participants 计划中的用户可以在更少限制下访问相关能力。
对普通开发团队而言,最重要的不是尝试绕过分类器,而是区分合法的防御性任务,并为被阻止或回退的请求提供明确的用户提示和人工处理路径。
Claude Pro、Max、Claude Code 和 API 怎么选?
| 使用方式 | 适合人群 | Opus 5 的位置 |
|---|---|---|
| Claude Pro | 个人日常研究、写作和开发 | 官方称其为 Pro 中最强模型 |
| Claude Max | 高频专业用户 | Opus 5 已是默认模型 |
| Claude Code | 终端内编码与代理任务 | 可直接用于编程工作流,Fast Mode 可通过 usage credits 使用 |
| Claude API | 产品集成、批处理和自建代理 | 使用 claude-opus-5,可自行控制流量、预算和回退 |
如果只是评估输出质量,可以先在 Claude 应用中建立测试样例;如果要测量 token、工具调用、错误率和成本,则应使用 API 或已有的工程评测框架。
上线前检查清单
- 模型 ID 已改为
claude-opus-5,且没有误改其他环境; - API Key 通过环境变量或密钥管理服务提供;
- 使用真实、脱敏的生产任务建立回归测试集;
- 记录输入输出 token、延迟、工具调用和成功率;
- 按“每个成功任务”比较成本,而不只比较单价;
- Fast Mode 有独立预算与监控;
- effort 从低或中等设置开始,按失败条件升级;
- 高风险工具仍受权限和人工确认控制;
- 自动模型回退在日志中可见;
- 灰度发布期间保留 Opus 4.8 回退路径。
Opus 5:API、Fast Mode 与迁移
Claude Opus 5 的产品定位
Anthropic 在发布说明中把 Opus 5 描述为一款更“周到且主动”的模型。这里的主动并不是未经允许执行危险操作,而是面对开放式任务时,能够补齐必要步骤、创建测试工具并检查自己的结果。
官方给出的几个案例很能说明这种变化:
- 在 FreeCAD 中完成计算机视觉流水线,而不是只生成一段孤立代码;
- 定位一个包管理器问题的根本原因,而不是停留在表面报错;
- 构建交易市场数据源,并自行创建测试工具验证行为。
这类任务有一个共同点:用户给出的目标通常不完整,模型必须在多个步骤之间保持状态,还要判断何时需要验证。对 Claude Code、内部研发代理和桌面自动化而言,这比单轮问答分数更有参考价值。
与 Opus 4.8、Fable 5、Mythos 5 怎么比较?
根据 Anthropic 的官方定位,可以做如下理解:
| 模型 | 更适合的定位 | 官方比较中的关键信息 |
|---|---|---|
| Claude Opus 4.8 | 已稳定运行的现有 Opus 工作负载 | Opus 5 保持相同基础单价,并在多项能力上提升 |
| Claude Opus 5 | 高难度通用代理、编程、科研和工具操作 | 接近 Fable 5 的前沿智能,价格约为其一半 |
| Claude Fable 5 | 追求最高能力上限的任务 | CursorBench 3.2 中仍保持极小领先,但任务成本更高 |
| Claude Mythos 5 | 更偏前沿网络安全能力 | 官方明确表示 Opus 5 在网络安全方面落后于 Mythos 5 |
这张表不能替代你自己的测试。尤其是“接近”“领先”等结论都依赖特定基准、努力等级和工具环境,不能直接等同于所有业务场景中的效果。
官方公布了哪些性能提升?
Anthropic 公布的结果主要覆盖代理任务、编程、计算机操作、科研和视觉输出。
1. 代理与真实工作任务
在 Frontier-Bench v0.1 上,Opus 5 的表现超过 Opus 4.8 的两倍,同时每个任务的成本更低。Anthropic 还表示,Opus 5 在 Frontier-Bench 和 GDPval-AA 上达到新的最佳成绩。
这些基准更关注完成整个任务,而不是回答一道静态题目,因此对代理类应用有一定参考价值。但生产环境还应记录失败后的重试次数,因为一次运行价格较高、却能减少两次重试的模型,最终可能更便宜。
2. 编程与工具使用
在 CursorBench 3.2 的最高努力设置下,Opus 5 距离 Fable 5 的最佳成绩只有 0.5%,每个任务的成本则约为后者的一半。
官方还强调了模型对复杂工具链的处理能力。迁移 Claude Code 工作流时,建议重点测试以下类型的任务:
- 跨多个文件追踪 bug;
- 读取日志后定位根因并补充测试;
- 修改代码后执行构建、测试和格式检查;
- 在需求不完整时识别约束,而不是过早提交实现;
- 需要连续调用多个 MCP 工具的操作流程。
3. 计算机操作与自动化
在 OSWorld 2.0 中,Opus 5 在相近成本下超过其他模型;官方称它以略高于 Fable 5 三分之一的成本,超过了后者的最佳成绩。
在 Zapier AutomationBench 上,Opus 5 的得分约为同等任务成本下次优模型的 1.5 倍。即使采用最低努力等级,它仍完成了最多任务。
这意味着低努力等级不一定只适合简单聊天。对于结构明确的自动化任务,它可能成为控制 token 和延迟的实用选择。
4. 科研与视觉任务
Anthropic 表示,Opus 5 在所有生命科学评测上都优于 Opus 4.8。其中内部有机化学评测提高 10.2 个百分点,蛋白质变异评测提高 7.7 个百分点。
此外,模型生成的网页、幻灯片和其他视觉成果也有所改进。不过这些仍然是发布方提供的评测和示例。涉及科研结论、医疗信息或实验设计时,必须保留人工复核和来源验证,不能把更高基准分数当作事实正确性的保证。
Claude Opus 5 API 价格
Opus 5 的基础 API 价格如下:
| 项目 | 价格 |
|---|---|
| 输入 token | 5 美元 / 100 万 token |
| 输出 token | 25 美元 / 100 万 token |
| Fast Mode | 基础费率的 2 倍 |
以上是发布说明中给出的基础价格。提示缓存、批处理或云平台渠道可能采用不同计费规则,正式预算仍应以调用渠道当时的账单说明为准。
一次请求大约多少钱?
假设一个长任务累计使用:
- 输入 100 万 token;
- 输出 20 万 token。
默认模式的基础费用为:
|
|
如果相同 token 用量全部按 Fast Mode 的两倍费率计算,则约为 20 美元。
真实代理任务不能只按单次调用估算。更有用的指标是“每个成功任务成本”:
|
|
一个便宜模型如果频繁重试、需要人工接管,最终成本可能比 Opus 5 更高;反过来,简单任务使用 Opus 5 也可能没有足够收益。
使用 API 调用 Claude Opus 5
curl 示例
先把 API Key 放入环境变量,再调用 Messages API。不要把真实密钥写进脚本或提交到 Git 仓库。
|
|
Windows PowerShell 中可以先设置当前会话环境变量:
|
|
然后使用 Anthropic SDK,或者按照当前官方文档构造请求。环境变量只对当前 PowerShell 会话生效,更适合临时测试。
Python SDK 示例
安装 SDK:
|
|
创建最小调用脚本:
|
|
生产环境至少应额外记录:
- 请求使用的模型 ID;
- 输入与输出 token;
- 总耗时和首 token 延迟;
- 工具调用次数与失败原因;
- 是否发生模型回退;
- 最终任务是否由人工接管。
只记录 HTTP 200 并不足以衡量代理任务是否成功。
Fast Mode 适合什么场景?
Opus 5 的 Fast Mode 速度约为默认模式的 2.5 倍,价格则为基础费率的 2 倍。Claude Platform 可以使用该模式,Claude Code 也可通过 usage credits 使用。
适合优先测试 Fast Mode 的场景包括:
- 开发者正在等待的交互式 Claude Code 会话;
- 需要快速迭代的线上事故分析;
- 演示、结对编程和实时工具操作;
- 延迟对业务价值的影响高于单次 token 成本的流程。
不适合默认开启的场景包括:
- 夜间批处理;
- 可以排队运行的离线代码审查;
- 大规模低优先级数据整理;
- 尚未建立费用上限和监控的代理循环。
建议为 Fast Mode 设置独立预算标签,并比较 P50、P95 延迟和每个成功任务成本。仅看到“快 2.5 倍”就给所有请求开启,通常无法得到最优成本结构。
Effort 设置如何使用?
Opus 5 提供不同 effort 设置,用于在智能水平、token 用量、延迟与成本之间取舍。Anthropic 的发布数据表明,低 effort 在部分自动化基准中仍具有竞争力,而最高 effort 更适合逼近模型能力上限。
可以采用分层策略:
| 任务 | 建议起点 | 升级条件 |
|---|---|---|
| 格式转换、固定规则抽取 | 低 effort | 格式错误或遗漏率超标 |
| 常规编码、单仓库排错 | 中等 effort | 多次工具调用后仍无法定位 |
| 跨系统故障、架构设计 | 高 effort | 任务价值足以覆盖额外 token |
| 前沿研究或高难度代理评测 | 最高 effort | 需要验证能力上限 |
具体参数名和可用范围可能随 SDK 或平台更新,不应凭发布稿猜测请求字段。接入时应以所用 API 版本的官方文档为准。
怎么选:按任务复杂度分层
可以按下面这个顺序选:
-
默认先试 Sonnet 5
适合大多数编码、文档、Agent、企业自动化任务。 -
任务明显复杂时升到 Opus 4.8
比如长代码库、多工具、多步骤、需要稳定执行和较强推理的场景。 -
追求最高能力时试 Fable 5
适合高价值、长流程、失败成本高、对价格不那么敏感的任务。 -
高吞吐轻任务用 Haiku 4.5
适合分类、抽取、摘要、客服、批处理和低延迟交互。 -
Mythos 5 只在有权限时考虑
它不是普通开发者默认可选项。
迁移和成本上的两个细节
第一,较新的 Claude 模型使用了新 tokenizer。Anthropic 文档说明,Opus 4.7 及之后的 Opus、Fable 5、Mythos 5、Mythos Preview 和 Sonnet 5 的 tokenizer 会让相同文本大约多出 30% token。做成本估算时,不能只看每百万 token 单价。
第二,1M 上下文不等于每次都应该塞满上下文。Fable 5、Opus 4.8、Sonnet 5 都支持 1M token,上下文很大,但工具调用、缓存、输出和多轮 Agent 都会叠加成本。实际部署时,更好的做法是:
- 常用系统提示和长背景用 prompt caching。
- 长文档先分块抽取,再交给高能力模型做综合判断。
- 简单步骤交给 Haiku 或 Sonnet,关键决策再升级 Opus / Fable。
- 用真实任务跑小样本,而不是只看官方 benchmark。
一个简单结论
Claude 当前的模型线已经很清晰:
- Fable 5:最高能力,适合最难和最高价值任务。
- Opus 4.8:复杂 Agent 编码和企业任务的强力选择。
- Sonnet 5:最适合日常默认,能力、速度和价格平衡。
- Haiku 4.5:最快最便宜,适合大规模轻任务。
- Mythos 5:受限可用,不当作常规选项。
如果你正在给产品或内部工作流选 Claude 模型,最实用的策略不是直接追最高档,而是把任务分层:Haiku 处理轻量批量任务,Sonnet 5 做默认执行层,Opus 4.8 处理复杂 Agent 和高难编码,Fable 5 留给最难、最贵、最值得的那一小部分任务。
模型路由建议
给 Claude 模型做选型时,最好不要只做“一个默认模型”。更实用的方式是设计一套路由规则:轻量批处理走 Haiku,日常编码和知识工作走 Sonnet,复杂仓库任务和多步骤 Agent 走 Opus,最高价值、最高难度任务再升级到 Fable。
路由规则可以先简单一点。例如摘要、分类、字段抽取优先 Haiku;PR review、文档生成、普通代码修改优先 Sonnet;跨模块重构、事故复盘、复杂规划优先 Opus;如果 Opus 连续失败或任务价值很高,再交给 Fable。
还要给每一档设置退出条件。模型输出不确定、工具调用失败、测试连续不过、上下文超过阈值、任务涉及权限或生产数据时,都应该触发人工确认,而不是继续自动推进。
成本评估方法
模型价格表只能做粗算。真实成本取决于上下文长度、缓存命中率、重试次数、输出长度和人工返工时间。一个更贵的模型如果一次完成率高,可能比便宜模型多次重试更省。
建议为每类任务记录三项数据:平均 token 成本、平均人工验收时间、失败后升级模型的比例。跑两周之后,通常就能看出哪些任务该放在 Sonnet,哪些任务值得上 Opus 或 Fable。
参考资料: