不确定选哪款时,先用 Claude Opus 5.5 建立质量基线;长程 Agent 或高难度推理再评估 Fable 5.1;日常开发和写作可以比较 Sonnet 5;低延迟、大批量任务优先试 Haiku 4.5。 选型应看目标任务的验收率、时延和总成本,不要把型号名称当成质量排行榜。
本文整理的是 Anthropic Claude API 的通用模型,不代表 Claude 网页订阅、Claude Code 套餐或 AWS、Google Cloud 等平台的账单完全相同。模型目录和价格会更新,本文按 2026 年 9 月 25 日 的 Anthropic 官方文档核对。
当前主力模型:能力、上下文与标准价格
| 模型 | API ID | 官方定位 | 上下文 / 最大输出 | 输入 / 输出价格(美元 / 百万 token) |
|---|---|---|---|---|
| Claude Fable 5.1 | claude-fable-5-1 |
高难度推理、长程 Agent | 1M / 128K | $10 / $50 |
| Claude Opus 5.5 | claude-opus-5-5 |
长时间 Agent 编程与知识工作;官方建议多数任务先从它开始 | 1M / 128K | $4 / $20 |
| Claude Sonnet 5 | claude-sonnet-5 |
速度和智能的平衡 | 1M / 128K | $2 / $10 |
| Claude Haiku 4.5 | claude-haiku-4-5 |
最快,兼顾接近前沿的能力 | 200K / 64K | $1 / $5 |
上表是 Anthropic 第一方 API 的基础 token 价格。提示缓存、Batch API、快速模式、数据驻留和云平台会改变实际费用;调用前应查看对应渠道的现行价格。模型目录 · API 定价
Fable 5.1、Opus 5.5、Sonnet 5 和 Haiku 4.5 都支持文本与图像输入、文本输出、多语言能力、视觉和工具调用。不同之处主要在任务上限、速度、成本和上下文容量,而不是简单的功能有无。
Opus、Sonnet、Haiku 应该怎么分工
Opus 5.5:先建立可用质量基线
Anthropic 目前建议不确定时从 Opus 5.5 开始。它面向长时间运行的 Agent 编程和知识工作,标准 API 价格为每百万输入 token 4 美元、每百万输出 token 20 美元。1M 上下文和 128K 输出上限适合需要跨文件、跨步骤持续工作的任务。
可优先用它评估复杂仓库改动、跨工具调查、长文档综合和多步骤业务流程。它不一定是成本最低的默认项:当任务范围清楚、结果容易校验时,应把相同输入交给 Sonnet 或 Haiku 做对照。
Fable 5.1:只在高难度任务确实需要时升级
Fable 5.1 面向高要求推理和长程 Agent 工作,输入与输出单价分别为 Opus 5.5 的 2.5 倍。若 Opus 5.5 在较高 effort 下仍不能稳定达到验收标准,或任务价值足以覆盖更高费用,再把 Fable 纳入评测。
不要只凭模型名称推断它一定更适合所有编码、研究或长上下文任务。应记录它具体减少了哪些失败、返工或人工检查,并确认收益超过实际增量成本。
Sonnet 5:日常工作值得与 Opus 做同题比较
Sonnet 5 的标准价格为每百万输入 2 美元、输出 10 美元,官方将其定位为速度和智能的组合。它适合日常代码修改、文档处理、分析、常规工具调用和对延迟比较敏感的工作。
Sonnet 5 的单价是 Opus 5.5 的一半,但这不等于每项任务的总成本都恰好减半。不同模型可能产生不同数量的思考 token、工具调用、重试和人工返工。需要用真实工作负载比较。
Haiku 4.5:给边界清楚、吞吐量大的请求
Haiku 4.5 每百万输入 token 1 美元、输出 5 美元,官方将其定位为速度最快的当前模型。它的上下文为 200K、最大输出为 64K,低于另外三款通用主力型号。
分类、字段提取、短摘要、格式转换、简单问答和批量分流是较合适的起点。应提供明确的输出 schema 和校验规则;若请求需要长程规划、复杂判断或多轮工具协作,就让 Sonnet 或 Opus 作为升级路线。
价格表之外的费用
提示缓存
Anthropic 的提示缓存降低重复上下文的读取成本。标准规则包括:5 分钟缓存写入按基础输入价格的 1.25 倍计费,1 小时写入按 2 倍计费;读取已缓存内容通常按基础输入价的 0.1 倍计费。Fable 5.1 与 Opus 5.5 的读取倍率更低,分别为 0.025 倍和 0.05 倍。缓存是否划算取决于写入成本和后续命中次数,需按模型单独计算。缓存和定价细则
Batch API
Batch API 面向可异步处理的大批量请求,输入和输出 token 均可享受 50% 折扣。它不适合必须即时返回的交互,但对离线分类、归档、抽取和评估任务可能显著降低花费。
Opus 快速模式
截至核对日,快速模式适用于 Opus 5.5、Opus 5 和 Opus 4.8,并按更高费率收费。Opus 5.5 快速模式为每百万输入 8 美元、输出 40 美元;Opus 5 和 Opus 4.8 为 10 美元 / 50 美元。该模式仅在 Claude API 第一方提供,不能假设在 Claude Platform on AWS 或其他合作云平台可用。快速模式说明
旧型号和受限型号怎么处理
Opus 4.8、Opus 4.7、Sonnet 4.6 等旧版仍可能出现在既有配置或过渡工作流中。迁移时应检查准确 API ID、停用日期、上下文限制、提示缓存与 tokenizer 行为,不要仅替换一个名称就直接全量切换。新旧版本要在同一组脱敏样本上验证输出和工具行为。
Mythos 系列及其他受限预览型号不列入一般可选模型表。只有账号和平台已获准访问时,才应按对应官方文档评估;新闻稿或第三方接口出现型号字符串,不代表你的 API 项目能够调用它。
用自己的任务决定默认模型
建立一组能代表日常工作的脱敏样本,覆盖成功请求、边界输入、历史失败、工具异常和长上下文。固定提示词、工具定义、输出限制和验收规则,然后依次比较 Opus 5.5、Sonnet 5;只有高难度样本仍不通过时,再加入 Fable 5.1。对简单且大量的请求,另外测 Haiku 4.5。
建议记录以下数据:
| 指标 | 记录内容 |
|---|---|
| 任务质量 | 是否通过相同验收规则,错误类型是什么 |
| 实际成本 | 输入、输出、缓存、重试和额外工具费用 |
| 完成时间 | 首 token 时延和端到端完成时间 |
| 人工返工 | 复核、修改、重新运行花费的时间 |
| 工具稳定性 | 调用是否正确,失败后是否能恢复 |
先设定最低可接受质量,再比较通过验收的总成本。这样得到的路由规则可能是 Haiku 处理分类、Sonnet 承担常规工作、Opus 处理难题、Fable 只接手少数高价值长任务,而不是整条产品只绑定一个型号。
站内旧版 Claude 模型对比已收拢
此前发布的《Claude Fable、Opus、Sonnet、Haiku 选型文章》,以及围绕 Opus 4.7、Sonnet 4.6、Haiku 4.5 的旧版选型稿,已将有用的型号分工和迁移信息合并到本文。本文更新了当前主力型号、价格与上下文信息;旧文章 URL 会直接跳转到本页,后续统一以本页为选型入口。
官方资料
- Claude Models Overview:当前模型建议、API ID、上下文和输出限制。
- Claude API Pricing:基础价格、提示缓存、Batch API、数据驻留和快速模式。