Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5。它并不是单纯把基准分数再向上推一点,而是试图在前沿能力、任务成本和自主工作能力之间取得更实用的平衡:官方称其能力接近 Claude Fable 5,但价格只有后者的一半;与 Opus 4.8 相比,基础 API 单价保持不变。
对于开发者,最直接的变化是新模型标识已经可用:
|
|
本文不只罗列发布数据,还会回答更实际的问题:是否值得从 Opus 4.8 升级、一次典型 API 请求要花多少钱、Fast Mode 适合什么场景,以及安全分类器触发后的回退机制会怎样影响生产系统。
Quick Answer:Claude Opus 5 值得升级吗?
如果你的任务包含长链路编程、跨工具操作、复杂故障定位、科研分析或需要模型主动验证结果,Opus 5 值得优先做一轮回归测试。它的优势并非只在一次回答的质量,而在于能够自己制定步骤、调用工具、发现错误并继续修正。
如果你的应用主要是短文本分类、固定格式抽取或成本敏感的高并发请求,则不应只因为“新模型”就直接切换。先使用现有真实流量建立测试集,对比成功率、输出 token、端到端耗时和每个成功任务的成本,再决定是否迁移。
可以先记住四个结论:
- API 模型 ID 是
claude-opus-5。 - 基础价格为每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 相同。
- Fast Mode 约为默认模式的 2.5 倍速度,但价格为基础费率的 2 倍。
- Claude 网页端、Claude Code、Cowork 与 API 均已提供 Opus 5,但不同订阅方案中的默认位置不同。
Claude Opus 5 的产品定位
Anthropic 在发布说明中把 Opus 5 描述为一款更“周到且主动”的模型。这里的主动并不是未经允许执行危险操作,而是面对开放式任务时,能够补齐必要步骤、创建测试工具并检查自己的结果。
官方给出的几个案例很能说明这种变化:
- 在 FreeCAD 中完成计算机视觉流水线,而不是只生成一段孤立代码;
- 定位一个包管理器问题的根本原因,而不是停留在表面报错;
- 构建交易市场数据源,并自行创建测试工具验证行为。
这类任务有一个共同点:用户给出的目标通常不完整,模型必须在多个步骤之间保持状态,还要判断何时需要验证。对 Claude Code、内部研发代理和桌面自动化而言,这比单轮问答分数更有参考价值。
与 Opus 4.8、Fable 5、Mythos 5 怎么比较?
根据 Anthropic 的官方定位,可以做如下理解:
| 模型 | 更适合的定位 | 官方比较中的关键信息 |
|---|---|---|
| Claude Opus 4.8 | 已稳定运行的现有 Opus 工作负载 | Opus 5 保持相同基础单价,并在多项能力上提升 |
| Claude Opus 5 | 高难度通用代理、编程、科研和工具操作 | 接近 Fable 5 的前沿智能,价格约为其一半 |
| Claude Fable 5 | 追求最高能力上限的任务 | CursorBench 3.2 中仍保持极小领先,但任务成本更高 |
| Claude Mythos 5 | 更偏前沿网络安全能力 | 官方明确表示 Opus 5 在网络安全方面落后于 Mythos 5 |
这张表不能替代你自己的测试。尤其是“接近”“领先”等结论都依赖特定基准、努力等级和工具环境,不能直接等同于所有业务场景中的效果。
官方公布了哪些性能提升?
Anthropic 公布的结果主要覆盖代理任务、编程、计算机操作、科研和视觉输出。
1. 代理与真实工作任务
在 Frontier-Bench v0.1 上,Opus 5 的表现超过 Opus 4.8 的两倍,同时每个任务的成本更低。Anthropic 还表示,Opus 5 在 Frontier-Bench 和 GDPval-AA 上达到新的最佳成绩。
这些基准更关注完成整个任务,而不是回答一道静态题目,因此对代理类应用有一定参考价值。但生产环境还应记录失败后的重试次数,因为一次运行价格较高、却能减少两次重试的模型,最终可能更便宜。
2. 编程与工具使用
在 CursorBench 3.2 的最高努力设置下,Opus 5 距离 Fable 5 的最佳成绩只有 0.5%,每个任务的成本则约为后者的一半。
官方还强调了模型对复杂工具链的处理能力。迁移 Claude Code 工作流时,建议重点测试以下类型的任务:
- 跨多个文件追踪 bug;
- 读取日志后定位根因并补充测试;
- 修改代码后执行构建、测试和格式检查;
- 在需求不完整时识别约束,而不是过早提交实现;
- 需要连续调用多个 MCP 工具的操作流程。
3. 计算机操作与自动化
在 OSWorld 2.0 中,Opus 5 在相近成本下超过其他模型;官方称它以略高于 Fable 5 三分之一的成本,超过了后者的最佳成绩。
在 Zapier AutomationBench 上,Opus 5 的得分约为同等任务成本下次优模型的 1.5 倍。即使采用最低努力等级,它仍完成了最多任务。
这意味着低努力等级不一定只适合简单聊天。对于结构明确的自动化任务,它可能成为控制 token 和延迟的实用选择。
4. 科研与视觉任务
Anthropic 表示,Opus 5 在所有生命科学评测上都优于 Opus 4.8。其中内部有机化学评测提高 10.2 个百分点,蛋白质变异评测提高 7.7 个百分点。
此外,模型生成的网页、幻灯片和其他视觉成果也有所改进。不过这些仍然是发布方提供的评测和示例。涉及科研结论、医疗信息或实验设计时,必须保留人工复核和来源验证,不能把更高基准分数当作事实正确性的保证。
Claude Opus 5 API 价格
Opus 5 的基础 API 价格如下:
| 项目 | 价格 |
|---|---|
| 输入 token | 5 美元 / 100 万 token |
| 输出 token | 25 美元 / 100 万 token |
| Fast Mode | 基础费率的 2 倍 |
以上是发布说明中给出的基础价格。提示缓存、批处理或云平台渠道可能采用不同计费规则,正式预算仍应以调用渠道当时的账单说明为准。
一次请求大约多少钱?
假设一个长任务累计使用:
- 输入 100 万 token;
- 输出 20 万 token。
默认模式的基础费用为:
|
|
如果相同 token 用量全部按 Fast Mode 的两倍费率计算,则约为 20 美元。
真实代理任务不能只按单次调用估算。更有用的指标是“每个成功任务成本”:
|
|
一个便宜模型如果频繁重试、需要人工接管,最终成本可能比 Opus 5 更高;反过来,简单任务使用 Opus 5 也可能没有足够收益。
使用 API 调用 Claude Opus 5
curl 示例
先把 API Key 放入环境变量,再调用 Messages API。不要把真实密钥写进脚本或提交到 Git 仓库。
|
|
Windows PowerShell 中可以先设置当前会话环境变量:
|
|
然后使用 Anthropic SDK,或者按照当前官方文档构造请求。环境变量只对当前 PowerShell 会话生效,更适合临时测试。
Python SDK 示例
安装 SDK:
|
|
创建最小调用脚本:
|
|
生产环境至少应额外记录:
- 请求使用的模型 ID;
- 输入与输出 token;
- 总耗时和首 token 延迟;
- 工具调用次数与失败原因;
- 是否发生模型回退;
- 最终任务是否由人工接管。
只记录 HTTP 200 并不足以衡量代理任务是否成功。
Fast Mode 适合什么场景?
Opus 5 的 Fast Mode 速度约为默认模式的 2.5 倍,价格则为基础费率的 2 倍。Claude Platform 可以使用该模式,Claude Code 也可通过 usage credits 使用。
适合优先测试 Fast Mode 的场景包括:
- 开发者正在等待的交互式 Claude Code 会话;
- 需要快速迭代的线上事故分析;
- 演示、结对编程和实时工具操作;
- 延迟对业务价值的影响高于单次 token 成本的流程。
不适合默认开启的场景包括:
- 夜间批处理;
- 可以排队运行的离线代码审查;
- 大规模低优先级数据整理;
- 尚未建立费用上限和监控的代理循环。
建议为 Fast Mode 设置独立预算标签,并比较 P50、P95 延迟和每个成功任务成本。仅看到“快 2.5 倍”就给所有请求开启,通常无法得到最优成本结构。
Effort 设置如何使用?
Opus 5 提供不同 effort 设置,用于在智能水平、token 用量、延迟与成本之间取舍。Anthropic 的发布数据表明,低 effort 在部分自动化基准中仍具有竞争力,而最高 effort 更适合逼近模型能力上限。
可以采用分层策略:
| 任务 | 建议起点 | 升级条件 |
|---|---|---|
| 格式转换、固定规则抽取 | 低 effort | 格式错误或遗漏率超标 |
| 常规编码、单仓库排错 | 中等 effort | 多次工具调用后仍无法定位 |
| 跨系统故障、架构设计 | 高 effort | 任务价值足以覆盖额外 token |
| 前沿研究或高难度代理评测 | 最高 effort | 需要验证能力上限 |
具体参数名和可用范围可能随 SDK 或平台更新,不应凭发布稿猜测请求字段。接入时应以所用 API 版本的官方文档为准。
从 Claude Opus 4.8 迁移到 Opus 5
不要只把模型字符串替换后立即全量上线。更稳妥的迁移流程如下。
第一步:固定真实测试集
从生产日志中选取 30 至 100 个已脱敏任务,覆盖:
- 正常成功案例;
- 曾经需要重试的案例;
- 工具调用失败案例;
- 长上下文和高输出任务;
- 可能触发安全分类器的合法任务。
测试集应保留预期结果或人工评分标准,否则只能比较文风,不能比较任务成功率。
第二步:只修改模型 ID
先保持提示词、工具定义、最大输出长度和超时不变,把模型切换为:
|
|
这样可以把模型变化与其他配置变化分开。若同时重写提示词和工具 schema,出现回归时很难定位原因。
第三步:比较四类指标
至少比较:
- 最终任务成功率;
- 输入、输出和总 token;
- P50、P95 端到端延迟;
- 每个成功任务的实际成本。
代理任务还应单独记录工具调用次数、无效循环次数和人工接管率。
第四步:重新校准提示词
Opus 5 更主动,旧提示词中大量“请继续检查”“请自行验证”的重复指令可能不再必要。可以逐步删除冗余要求,但必须保留业务边界,例如:
- 未经批准不得部署;
- 不得删除生产数据;
- 修改前先输出证据;
- 密钥和个人信息不得进入日志;
- 高风险操作必须等待人工确认。
主动性增强不等于授权范围扩大。
第五步:灰度发布并保留回退
先将少量流量切到 Opus 5,再逐步扩大。回退条件可以包括:
- 错误率超过阈值;
- P95 延迟明显恶化;
- 单任务成本超出预算;
- 工具调用出现重复循环;
- 安全分类器回退比例异常上升。
回退策略本身也要测试,不能等生产请求触发后才确认日志和响应格式是否兼容。
两项 API Beta 更新
Anthropic 同时介绍了两项与 Opus 5 配合的 API Beta 能力。
对话中途修改工具
应用可以在对话进行过程中更改可用工具,而不会让提示缓存失效。这对长时间运行的代理很有用:系统可以按任务阶段加载数据库、浏览器或部署工具,不必从一开始就把所有工具定义塞进上下文。
潜在收益包括:
- 减少无关工具对模型选择的干扰;
- 保留提示缓存,降低重复上下文成本;
- 根据权限和任务状态动态开放工具;
- 缩小高风险工具的暴露时间窗口。
分类器触发后的自动模型回退
API 可以在安全分类器标记请求后自动切换到另一个模型。默认设置会选择当前可用的最佳替代模型,也可以根据业务需要配置回退策略。
接入该功能时,应把“实际响应模型”纳入可观测性。否则应用看到请求成功,却不知道同一测试集为何出现输出风格、延迟或能力差异。
安全机制会怎样影响开发者?
Anthropic 表示,Opus 5 在自动化对齐审计中的总体不当行为得分为 2.3,是近期模型中最低的。同时,官方认为它没有推进高风险双用途能力的前沿,在生物和进攻性网络安全方面落后于 Mythos 5。
网络安全场景的边界尤其值得注意:
- 源代码漏洞发现可以被允许;
- 二进制漏洞扫描、渗透测试和漏洞利用生成可能被阻止;
- Opus 5 的漏洞发现能力有所提高,但漏洞利用开发仍明显落后于 Mythos 5;
- 新分类器预计比 Fable 5 减少约 85% 的干预。
在 Claude.ai、Claude Code 和 Cowork 中,被标记的请求默认会回退到 Opus 4.8。API 用户也可以启用回退。Claude Verified Participants 计划中的用户可以在更少限制下访问相关能力。
对普通开发团队而言,最重要的不是尝试绕过分类器,而是区分合法的防御性任务,并为被阻止或回退的请求提供明确的用户提示和人工处理路径。
Claude Pro、Max、Claude Code 和 API 怎么选?
| 使用方式 | 适合人群 | Opus 5 的位置 |
|---|---|---|
| Claude Pro | 个人日常研究、写作和开发 | 官方称其为 Pro 中最强模型 |
| Claude Max | 高频专业用户 | Opus 5 已是默认模型 |
| Claude Code | 终端内编码与代理任务 | 可直接用于编程工作流,Fast Mode 可通过 usage credits 使用 |
| Claude API | 产品集成、批处理和自建代理 | 使用 claude-opus-5,可自行控制流量、预算和回退 |
如果只是评估输出质量,可以先在 Claude 应用中建立测试样例;如果要测量 token、工具调用、错误率和成本,则应使用 API 或已有的工程评测框架。
上线前检查清单
- 模型 ID 已改为
claude-opus-5,且没有误改其他环境; - API Key 通过环境变量或密钥管理服务提供;
- 使用真实、脱敏的生产任务建立回归测试集;
- 记录输入输出 token、延迟、工具调用和成功率;
- 按“每个成功任务”比较成本,而不只比较单价;
- Fast Mode 有独立预算与监控;
- effort 从低或中等设置开始,按失败条件升级;
- 高风险工具仍受权限和人工确认控制;
- 自动模型回退在日志中可见;
- 灰度发布期间保留 Opus 4.8 回退路径。
常见问题
Claude Opus 5 的 API 模型名称是什么?
官方公布的模型 ID 是 claude-opus-5。
Opus 5 比 Opus 4.8 更贵吗?
基础 API 单价没有提高,仍为每百万输入 token 5 美元、每百万输出 token 25 美元。不过实际账单还取决于输出长度、重试、缓存、工具循环和是否启用 Fast Mode。
Fast Mode 会提高模型质量吗?
官方强调的是速度提升,而不是更高智能。它约为默认模式的 2.5 倍速度,价格为基础费率的 2 倍。是否值得使用应以交互延迟带来的业务价值衡量。
现有 Opus 4.8 提示词能直接使用吗?
通常可以作为迁移起点,但不应跳过回归测试。Opus 5 更主动,旧提示词可能包含冗余步骤;工具调用、安全边界和回退行为也需要重新验证。
Opus 5 适合网络安全工作吗?
它可以支持合法的源代码漏洞发现和防御性分析,但官方分类器会限制二进制扫描、渗透测试和漏洞利用生成等高风险请求。相关团队应按授权范围设计工作流,并预期部分请求可能被阻止或回退。
总结
Claude Opus 5 的核心价值,是以与 Opus 4.8 相同的基础价格,提供更强的代理执行、编程、计算机操作和科研能力。它与 Fable 5 的差距在部分编程评测中已经很小,但任务成本更低;同时,Anthropic 通过分类器和自动回退限制高风险网络安全能力。
对现有用户,最合理的动作不是立即全量切换,而是用真实任务完成一次受控迁移:固定测试集,只更换模型 ID,比较成功率、延迟和每个成功任务成本,再逐步调整 effort、Fast Mode 与提示词。这样才能判断 Opus 5 带来的究竟是更高基准分数,还是可量化的生产效率提升。