Anthropic の現在の Claude モデルラインは、もはや「Haiku は速い、Sonnet はバランス型、Opus は最強」だけでは説明できない。2026 年 7 月時点で、主なモデルには Claude Fable 5、Claude Opus 4.8、Claude Sonnet 5、Claude Haiku 4.5、そして限定提供の Claude Mythos 5 がある。
素早く選ぶなら、まず次のように考えるとよい。日常開発と多くの Agent タスクは Sonnet 5、複雑な企業 Agent と高難度コーディングは Opus 4.8、最高能力が必要なら Fable 5、低レイテンシやコスト重視なら Haiku 4.5。Mythos 5 は一般向けではなく、承認された顧客向けだ。
現在の主要モデル
| モデル | API ID / alias | 位置づけ | コンテキスト | 最大出力 | レイテンシ傾向 | 標準価格 |
|---|---|---|---|---|---|---|
| Claude Fable 5 | claude-fable-5 |
Anthropic の広く公開されたモデルの中で最高能力、長時間 Agent 向け | 1M tokens | 128k tokens | 遅め | 入力 $10 / MTok、出力 $50 / MTok |
| Claude Opus 4.8 | claude-opus-4-8 |
複雑な Agent コーディング、企業ワークフロー、ブラウザ/コンピュータ利用 | 1M tokens | 128k tokens | 中程度 | 入力 $5 / MTok、出力 $25 / MTok |
| Claude Sonnet 5 | claude-sonnet-5 |
速度、能力、価格のバランスが最もよく、デフォルト候補 | 1M tokens | 128k tokens | 速い | 2026-08-31 まで入力 $2 / MTok、出力 $10 / MTok;以後 $3 / $15 |
| Claude Haiku 4.5 | claude-haiku-4-5 |
最速・最安、軽量高スループットタスク向け | 200k tokens | 64k tokens | 最速 | 入力 $1 / MTok、出力 $5 / MTok |
| Claude Mythos 5 | claude-mythos-5 |
Fable 5 と同じ仕様・価格だが限定提供 | 1M tokens | 128k tokens | 遅め | 入力 $10 / MTok、出力 $50 / MTok |
MTok は million tokens、つまり 100 万 token を意味する。実際の価格は prompt caching、batch、データレジデンシー、クラウド地域などにも影響されるため、表には基本的な入出力価格だけを載せている。
Fable 5:最高能力だがデフォルトではない
Claude Fable 5 は、Anthropic が広く公開しているモデルの中で最も能力が高い。公式の位置づけは next-generation intelligence for long-running agents、つまり長時間 Agent 向けの次世代高能力モデルだ。
向いている用途は次の通り。
- 長時間・複数ステップで自律的に進む Agent ワークフロー。
- 複雑な研究、コード移行、システム横断の計画。
- 最高の推論能力と大きなコンテキストが必要な企業タスク。
- コストやレイテンシより価値が大きい高重要タスク。
ただし Fable 5 はデフォルトに向くとは限らない。最も高価で、遅延も大きい。最高能力が本当に必要でなければ、Sonnet 5 や Opus 4.8 から始める方が堅実だ。
もう一点、Fable 5 は adaptive thinking を使い、しかも always on だ。いつ、どれだけ推論するかを自動で決める。複雑なタスクには役立つが、コストと応答時間がタスクに依存しやすくなる。
Opus 4.8:複雑なコーディングと企業 Agent の堅実な選択
Claude Opus 4.8 は Fable 5 と Sonnet 5 の間に位置する。Anthropic は、複雑な Agent コーディングや企業作業でモデル選びに迷うなら Opus 4.8 から始めることを勧めている。
強みは次の通り。
- 1M token コンテキスト。
- 128k token 最大出力。
- 複雑なコーディング、ブラウザ Agent、コンピュータ利用、企業ワークフローに強い。
- 価格は Fable 5 の半分。
- adaptive thinking に対応。
Opus 4.8 は「高難度タスクのデフォルト」に向く。コードベース単位のリファクタリング、複雑な PR 修正、企業データ分析、複数ツール Agent、長文書推論などは、まず Opus 4.8 を基準にできる。
非常に難しいタスクで Opus 4.8 が足りなければ Fable 5 へ上げる。タスク量が多く、コスト圧力が強ければ Sonnet 5 へ下げる。
今回の更新の要点
Claude Opus 4.8 はすでに提供開始されており、価格は据え置きだ。公式はあわせて、いくつかの関連する変更も強調している。
- Opus 4.8 は、コード、エージェント能力、推論、知識作業の評価で前世代からさらに向上している。
claude.aiユーザーは、Claude がタスクに投入する effort を制御できる。- Claude Code に dynamic workflows が追加され、より大規模な問題を扱えるようになった。
- Opus 4.8 の fast mode は約 2.5 倍の速度で動作でき、以前のモデルの fast mode より 3 倍安い。
これらをまとめて見ると、Anthropic はモデルスコアを少し上げただけではない。「複雑なタスクを長時間実行する」ことを軸に、プロダクトの形を変えている。モデルの強化はその一部にすぎず、タスク制御、ワークフロー分解、コスト構造も同じくらい重要だ。
Claude Code ユーザーが特に注目すべき理由
Claude Code のようなコーディング agent にとって最も怖いのは、単一の関数を書けないことではなく、実際のリポジトリの中で迷うことだ。ファイルを読み、依存関係を理解し、テストを走らせ、エラーを確認し、方針を修正し、そのうえで変更範囲を妥当に保つ必要がある。
Opus 4.8 の訴求点は、まさにこれらの問題に近い。
- agentic tasks により適している。つまり、モデルが継続的に計画し、ツールを呼び出し、結果を観察し、戦略を調整する必要があるタスクだ。
- judgement をより重視しており、不確かなときに止まって確認できる。自信満々に間違ったまま進むのではない。
- dynamic workflows によって、Claude Code は大規模で多段階の問題を扱いやすくなる。
これらの能力が実プロジェクトで安定して働くなら、Claude Code の使い方は「明確な目標を渡して前に進めてもらう」ものに近づく。単に一部のコードを補完させるだけではなくなる。
effort 制御が意味するもの
Anthropic は今回 claude.ai に effort 制御を追加した。意味は直接的だ。ユーザーが、モデルにどれくらい力を使わせるかを調整できる。
これは日常利用でも実用的だ。簡単な質問に深い推論は不要だが、複雑なタスクではモデルに少し長く考えさせる価値がある。以前は多くのユーザーが、プロンプトで「もっと慎重に」や「早く答えて」と表現するしかなかった。今はこの種の制御がプロダクト層に入り始めている。
開発者にとっても、これは一つのシグナルだ。今後の agent 製品は「どのモデルを選ぶか」だけを見せるのではなく、速度、コスト、推論の深さ、ツール呼び出しの積極性、リスク許容度といった実行戦略も見せるようになる。
fast mode のコスト変化は重要
公式によると、Opus 4.8 の fast mode は約 2.5 倍の速度に達し、同時に以前のモデルの fast mode よりかなり低コストになる。
この点はモデル能力のニュースに隠れやすいが、実際のワークフローでは重要だ。多くの agent タスクは一度だけ実行されるのではなく、繰り返し実行される。
- 初稿を生成する
- テストを走らせる
- 失敗を修正する
- もう一度テストを走らせる
- review に応じてさらに修正する
fast mode が十分に安ければ、チームはトップモデルを重要タスクでたまに使うだけでなく、高頻度のフローにも組み込みやすくなる。速度とコストが下がって初めて、agent は「デモとして面白いもの」から「日常の道具」へ移りやすくなる。
Opus 4.7 との関係
Opus 4.8 は、利用しやすさに向けた強化版に近い。Opus 4.7 の位置づけを引き継ぎつつ、重点をさらにコーディング、エージェントタスク、専門的な作業へ押し進めている。
Anthropic の表現を見る限り、Opus 4.8 は単に回答がよくなっただけではない。より協働がうまくなった。タスクの中で、いつ情報が必要か、いつ方針が不安定か、いつ大きな変更の前に確信を固めるべきかを、より明確に扱えるはずだ。
この種の能力は、単一の benchmark だけでは判断しにくい。本当の検証は、大規模リポジトリ、複雑な業務ルール、長いコンテキストのタスク、複数回にわたる修正の中での挙動を見る必要がある。
AI コーディング競争への影響
2026 年のモデル競争は、「チャット能力」から「仕事をこなせるか」へ明確に移っている。OpenAI、Anthropic、Google、xAI はいずれも、モデルとツールチェーンをより強く結びつけている。モデルが推論を担い、ツールが実行を担い、プロダクト層がタスクを制御可能な範囲に保つ。
Claude Opus 4.8 のリリースは、この流れを引き継いでいる。焦点は単一の能力を誇示することではなく、三つの部分を強化することだ。
- モデル自体がコードとエージェントタスクにより適している。
- Claude Code がより大きなワークフローを分解できる。
- プロダクト層が effort や fast mode のような実行制御を提供し始めている。
開発者にとっての実際の意味は、モデル選びで「どれが一番賢いか」だけを見てはいけないということだ。使っているツールに合うか、安定してツールを呼べるか、長いタスクのコストが許容できるか、失敗したときに修正しやすいかも見る必要がある。
Sonnet 5:日常デフォルトに最も向く
Claude Sonnet 5 は、現在最も注目すべきデフォルト候補だ。位置づけは best combination of speed and intelligence、つまり速度と知能のバランスである。
向いている用途は次の通り。
- 日常的なコーディングとコードレビュー。
- ドキュメント整理、研究補助、知識作業。
- 中程度の複雑さの Agent。
- 企業内の自動化ワークフロー。
- コストを抑えつつ品質を大きく落とせない API アプリケーション。
Sonnet 5 の大きな変化は、これまで Opus に近かった多くの Agent 能力が Sonnet の価格帯に降りてきたことだ。同じく 1M token コンテキストと 128k token 最大出力に対応し、レイテンシは Opus より低い。
価格は 2026 年 8 月 31 日まで導入割引があり、入力 $2 / MTok、出力 $10 / MTok。2026 年 9 月 1 日以降は標準価格の入力 $3 / MTok、出力 $15 / MTok に戻る。標準価格でも Opus 4.8 より明らかに安い。
多くのチームの出発点としては、Sonnet 5 を第一候補にするのがよい。70〜80% のタスクをまず Sonnet 5 で覆い、本当に難しいタスクを Opus 4.8 や Fable 5 に上げる。
利用範囲と価格
Claude Sonnet 5 はすべての Claude プランで利用できる。
- Free と Pro ユーザーは Sonnet 5 をデフォルトで利用する。
- Max、Team、Enterprise ユーザーも Sonnet 5 を利用できる。
- Claude Code と Claude Platform は Sonnet 5 に対応済み。
- 開発者は Claude API でモデル名
claude-sonnet-5を指定できる。
API 価格は、導入期に低く、その後標準価格へ移る形になっている。
| 期間 | 入力価格 | 出力価格 |
|---|---|---|
| 2026 年 8 月 31 日まで | 100 万 token あたり 2 ドル | 100 万 token あたり 10 ドル |
| その後の標準価格 | 100 万 token あたり 3 ドル | 100 万 token あたり 15 ドル |
Anthropic は、Sonnet 5 が更新された tokenizer を使うとも説明している。同じ入力でも新 tokenizer では token 数が増える場合があり、内容によっておよそ 1.0〜1.35 倍になる。導入価格の目的のひとつは、Sonnet 4.6 からの移行コスト変化をなだらかにすることだ。
重点的な改善:Sonnet が実行層に近づいた
Sonnet 5 のキーワードは Agent だ。Anthropic は、計画を立て、ブラウザやターミナルなどのツールを使い、より長いタスクチェーンを継続実行できる点を強調している。
開発者や企業ユーザーにとって、意味はかなり明確だ。
- コーディングは断片補完にとどまらず、複数ステップの修正、デバッグ、検証に向く。
- ツール利用が安定し、ブラウザ、ターミナル、業務アプリ、社内ワークフローへ接続しやすい。
- 中程度の effort では費用対効果が高く、高い effort では一部タスクが Opus 4.8 に近づく。
- Claude Code ユーザーにとって、少数の難問だけに使う高価なモデルではなく、日常的な実行モデルになりやすい。
Anthropic は、複雑なコードベース、ブラウンフィールド開発、保険ワークフロー、法律調査、データ分析などでの初期パートナーのフィードバックを紹介している。共通するのは、Sonnet 5 が途中で止まったり助言だけで終わったりせず、タスクをより完整に追えるという点だ。
安全評価:より安全だが、無リスクではない
Anthropic の安全評価には二つの側面がある。
一方で、Sonnet 5 は Sonnet 4.6 より安定している。Agent 安全性、悪意ある要求の拒否、プロンプトインジェクション耐性、幻覚の削減、迎合の低減で改善がある。Anthropic の自動行動監査でも、望ましくない行動の割合は Sonnet 4.6 より低い。
他方で、より強い Opus 4.8 や Mythos Preview より安定しているわけではない。同じ安全評価では、Sonnet 5 の望ましくない行動率はこの二つのモデルより高い。
サイバーセキュリティ能力について、Anthropic は Sonnet 5 をサイバーセキュリティタスクで意図的に訓練していないとしている。通常の無害なセキュリティ作業はいくつかこなせるが、危険性のある能力評価では Opus 4.8 や Mythos 5 より明らかに弱い。Firefox の exploit 評価では、完全に使える exploit の生成には成功しなかったが、Sonnet 4.6 より部分成功率は高かった。
そのため、Sonnet 5 ではサイバーセキュリティ保護がデフォルトで有効になっている。危険なサイバーセキュリティ用途をリアルタイムに検出し、ブロックする仕組みで、強度は Claude Opus 4.7 や Opus 4.8 と近い。ただし Fable 5 のより厳格な保護よりは低い。
移行時に見るべきこと
Claude API や Claude Code をすでに使っているなら、Sonnet 5 は Sonnet 4.6 の直接的なアップグレード候補になる。ただし移行前に三点を確認したい。
第一に、モデル名は次のように変更する。
|
|
第二に、コストは単価だけで見ない。Sonnet 5 の標準価格は導入価格より高く、tokenizer の変更で一部入力の token 消費が増える可能性もある。長コンテキスト、ログ分析、コードベース走査では、実際のリクエストで再計算した方がよい。
第三に、effort 設定は費用対効果を左右する。Sonnet 5 は effort によって広い能力とコストの範囲をカバーできる。日常のコーディング、ドキュメント整理、軽量 Agent タスクでは最高 effort は不要かもしれない。長時間の計画や複数ツール連携が必要なときに effort を上げる方が合理的だ。
Opus 4.8 との関係
Sonnet 5 は Opus 4.8 を置き換えるものではない。より正確には、これまで Opus に近かった一部の Agent 能力が Sonnet レベルに降りてきた、と見るべきだ。
最高の上限が必要なタスク、特に複雑な研究、深い推論、長い Agent チェーン、高難度のコーディングでは、Opus 4.8 にはまだ役割がある。日常的なスループット、価格、安定した実行を重視するなら、Sonnet 5 はデフォルトモデルにしやすい。
今回の発表で最も重要なのはここだ。Sonnet 系列はもはや「速くて安い」中位モデルだけではなく、多くの実行型タスクを担い始めている。企業や開発者にとって、モデル選択は「Opus をデフォルトにして高ければ下げる」から、「Sonnet 5 をデフォルトにして必要なら Opus に上げる」へ変わりそうだ。
実践的な移行ガイド:タスクを分けてテストする
チームがすでに Sonnet 4.6 を使っているなら、すべての呼び出しを一気に Sonnet 5 へ切り替えるのはおすすめしない。軽量 Q&A、要約、コード説明、単一ファイル修正、複数ファイルのリファクタリング、長時間 Agent、ツール利用を伴う自動化タスクなど、難度とリスクで分類し、それぞれサンプルを用意する方が堅実だ。
第一ラウンドでは、回答が賢く見えるかではなく、完了率と手戻り率を見る。Claude Code なら、テストの修正漏れが減ったか、リポジトリ構造を安定して理解できるか、不確かなときに質問して止まれるかを比較する。
第二ラウンドではコストを見る。Sonnet 5 の tokenizer 変更で同じ入力でも token 数が増える可能性があるため、公開価格だけで計算せず、実際のログで測る。長コンテキスト、文書分析、コードベースタスクでは token 変化が請求に直結する。
第三ラウンドで初めてデフォルトモデルを決める。私なら、日常の Agent とコーディングタスクにはまず Sonnet 5 を候補にし、失敗時の再試行や高価値タスクに Opus/Fable を残し、軽量バッチ作業に Haiku を使う。この方が移行は滑らかで、本当に改善した部分も見つけやすい。
観察する指標
Sonnet 5 を試すときは、一次完了率、手作業の修正時間、ツール呼び出し失敗率、タスクあたりコストの四つを記録したい。benchmark だけでは誤解しやすい。実際のチームタスクは、コード、文書、環境、権限、コンテキスト記憶が混ざっているからだ。
あるタスク群で Sonnet 5 が旧モデルより安定するなら、そこから優先的に移行すればよい。単に回答が長くなり、変更が大胆になっただけなら、人間の確認を残すか、より保守的なプロンプトにした方がよい。
原文:Introducing Claude Sonnet 5
Haiku 4.5:高スループット、低遅延、低コスト
Claude Haiku 4.5 は現在の Claude 主力ラインで最速のモデルだ。公式には fastest model with near-frontier intelligence と位置づけられている。
向いている用途は次の通り。
- 分類、抽出、要約、形式変換。
- 短文のバッチ処理。
- カスタマーサポート、チケット、モデレーションなど高スループット用途。
- 低レイテンシが重要な対話型製品。
- 1M コンテキストを必要としない軽量タスク。
制限も明確だ。コンテキストは 200k tokens、最大出力は 64k tokens で、Fable、Opus、Sonnet の 1M / 128k より小さい。長いコードベース、複雑な複数文書分析、長時間 Agent には第一候補ではない。
しかし「大量・簡単・速さ重視」のタスクなら、Haiku 4.5 の費用対効果は非常にわかりやすい。入力 $1 / MTok、出力 $5 / MTok だ。
Mythos 5:通常の選択肢ではない
Claude Mythos 5 は Fable 5 と同じ仕様・価格だが、一般提供モデルではない。Anthropic の文書では limited availability とされ、Project Glasswing の承認済み顧客向けだ。
つまり通常の API 選定では、Mythos 5 を候補に入れる必要はほとんどない。すでに承認済みであるか、Anthropic、AWS、Google Cloud などのアカウントチームを通じてアクセスを得ていない限り、Fable 5 の直接代替にはならない。
Claude Opus 4.8 から Opus 5 への移行
モデル文字列を置き換えるだけでなく、すべてをすぐにオンラインにします。より堅牢な移行プロセスは次のとおりです。
ステップ 1:実運用に基づくテストセットを固定する
プロダクション ログから、以下をカバーする 30 ~ 100 個のマスクされたタスクを選択します。
- 通常の成功例。
- 一度再審理が必要となった事件。
- ツール呼び出しが失敗するケース。
- 長いコンテキストと大量の出力タスク。
- セキュリティ分類子をトリガーする可能性のある正当なタスク。
テスト セットには、期待される結果や手動の採点基準が保持されている必要があります。そうでない場合は、記述スタイルを比較することしかできず、タスクの成功率を比較することはできません。
ステップ 2: モデル ID のみを変更する
まず、プロンプト ワード、ツール定義、最大出力長、タイムアウトを変更せずに、モデルを次のように切り替えます。
|
|
これにより、モデルの変更が他の構成の変更から分離されます。プロンプトワードとツールスキーマを同時に書き換えると、リグレッションが発生した際に原因を特定することが困難になります。
ステップ 3:4 種類の指標を比較する
少なくとも以下を比較してください。
- 最終ミッション成功率;
- 入力、出力、および合計トークン。
- P50、P95 エンドツーエンド遅延。
- 成功したミッションごとの実際のコスト。
エージェント タスクは、ツール呼び出しの数、無効なサイクルの数、および手動引き継ぎ率も個別に記録する必要があります。
ステップ 4:プロンプトを再調整する
Opus 5 はより積極的であり、古いプロンプトの言葉にある「確認を続けてください」や「ご自身で確認してください」という大量の繰り返しの指示はもはや必要ありません。冗長性要件は段階的に廃止できますが、ビジネス境界は維持する必要があります。次に例を示します。
- 承認なしに展開はできません。
- 本番データは削除してはなりません。
- 変更前の証拠をエクスポートします。
- キーや個人情報をログに入力することは許可されません。
- リスクの高い操作は手動による確認を待つ必要があります。
自発性が高まったからといって、権限の範囲が拡大するわけではありません。
ステップ 5:段階的に展開し、ロールバック経路を残す
最初に少量のトラフィックを Opus 5 まで削減し、その後徐々に拡大します。フォールバック条件には次のものが含まれます。
- エラー率がしきい値を超えています。
- P95 潜伏期間が大幅に悪化しました。
- 単一タスクのコストが予算を超える。
- ツール呼び出しで繰り返しループが発生します。
- セキュリティ分類子のフォールバック率が異常に増加しました。
ロールバック戦略自体もテストする必要があり、ログと応答の形式に互換性があるかどうかを確認する前に、運用リクエストがトリガーされるのを待つことはできません。
2 つの API ベータ版アップデート
Anthropic は、Opus 5 で動作する 2 つの API ベータ機能も導入しました。
会話の途中でツールを変更する
アプリは、プロンプト キャッシュを無効にすることなく、会話の途中で利用可能なツールを変更できます。これは、長時間実行されるエージェントに役立ちます。システムは、最初からすべてのツール定義をコンテキストに詰め込むことなく、タスク フェーズごとにデータベース、ブラウザ、または展開ツールを読み込むことができます。
潜在的な利点は次のとおりです。
- モデル選択における無関係なツールの干渉を軽減します。
- 繰り返されるコンテキストのコストを削減するために、プロンプト キャッシュを保持します。
- 権限とタスクのステータスに基づいてツールを動的に開きます。
- 高リスクツールの露出ウィンドウを狭めます。
分類器が作動した後の自動モデルフォールバック
セキュリティ分類子がリクエストにフラグを立てた後、API は自動的に別のモデルに切り替えることができます。デフォルト設定では、現在利用可能な最適な代替モデルが選択され、ビジネス ニーズに基づいてフォールバック戦略を構成することもできます。
この機能にアクセスするときは、「実際の応答モデル」を可観測性に組み込む必要があります。それ以外の場合、アプリケーションはリクエストが成功したことを認識しますが、同じテスト セットで出力スタイル、レイテンシ、または機能に違いがある理由がわかりません。
セキュリティメカニズムは開発者にどのような影響を与えるのでしょうか?
Anthropic 社は、Opus 5 の自動調整監査における全体的な不正行為スコアは 2.3 で、最近のモデルの中で最も低いと述べました。同時に、当局は、生物学的および攻撃的サイバーセキュリティにおいてMythos 5に後れを取っており、高リスクの二重用途機能の最前線を推進していないと考えている。
サイバーセキュリティ シナリオの境界は特に注目に値します。
- ソースコードの脆弱性の発見を許可できます。
- バイナリ脆弱性スキャン、侵入テスト、エクスプロイト生成がブロックされる場合があります。
- Opus 5 の脆弱性発見機能は向上しましたが、脆弱性悪用の開発は依然として Mythos 5 に比べて大幅に遅れています。
- 新しい分類子は、Fable 5 よりも必要な介入が約 85% 少ないと予想されます。
Claude.ai、Claude Code、および Cowork では、フラグ付きリクエストはデフォルトで Opus 4.8 にフォールバックします。 API ユーザーはフォールバックを有効にすることもできます。 Claude Verified Participants プログラムのユーザーは、より少ない制限で機能にアクセスできます。
平均的な開発チームにとって最も重要なことは、分類子をバイパスしようとすることではなく、正当な防御タスクを区別し、ブロックまたはロールバックされたリクエストに対して明確なユーザー プロンプトと手動処理パスを提供することです。
Claude Pro、Max、Claude Code、API の選択方法は?
| 使い方 | 誰のためのもの | Opus 5 がある場所 |
|---|---|---|
| クロードプロ | 個人的な日々の研究、執筆、開発 | 正式にPro最強モデルと呼ばれる |
| クロード・マックス | 高周波プロユーザー | Opus 5 はすでにデフォルトのモデルです |
| クロード・コード | 端末内コーディングとエージェントのタスク | プログラミング ワークフローで直接使用できます。高速モードは使用クレジットを通じて利用可能です |
| クロードAPI | 製品統合、バッチ処理、および自己構築エージェント | claude-opus-5 を使用すると、トラフィック、予算、フォールバックを自分で制御できます。 |
出力品質を評価するだけの場合は、まず Claude アプリケーションでテスト ケースを作成します。トークン、ツール呼び出し、エラー率、コストを測定したい場合は、API または既存のエンジニアリング評価フレームワークを使用する必要があります。
発売前チェックリスト
- モデル ID は
claude-opus-5に変更されており、他の環境は誤って変更されていません。 - API キーは環境変数またはキー管理サービスを通じて提供されます。
- 実際の感度を下げた運用タスクを使用して回帰テスト セットを構築します。
- 入力トークンと出力トークン、遅延、ツール呼び出し、成功率を記録します。
- 単価だけではなく「成功したタスクごと」にコストを比較します。
- 高速モードには独立したバジェットとモニタリングがあります。
- の作業は低または中程度の設定から始まり、障害状況によって段階的に増加します。
- リスクの高いツールは引き続き権限と手動確認によって制御されます。
- 自動モデルのロールバックがログに表示されます。
- グレースケールのリリース中に Opus 4.8 フォールバック パスを保持します。
Opus 5:API、Fast Mode、移行
Claude Opus 5 の位置付け
Anthropic はリリースノートで Opus 5 をより「思慮深く、積極的な」モデルと説明しています。ここでの取り組みは、危険な行為を許可なく実行することではなく、未解決のタスクに直面したときに、必要な手順を完了し、テストツールを作成し、自分自身の結果を確認できるようにすることです。
いくつかの公式事例がこの変化を示しています。
- 孤立したコード部分を生成するだけでなく、FreeCAD でコンピューター ビジョン パイプラインを完成させます。
- 表面上のエラーを報告するだけでなく、パッケージ マネージャーの問題の根本原因を特定します。
- 取引市場データ ソースを構築し、動作を検証するための独自のテスト ツールを作成します。
このようなタスクには共通点が 1 つあります。それは、ユーザーが指定した目標が不完全であることが多く、モデルは複数のステップ間の状態を維持し、検証が必要なタイミングを判断する必要があるということです。 Claude Code、社内の R&D エージェント、デスクトップ オートメーションにとって、これは 1 つの Q&A スコアよりも価値があります。
Opus 4.8、Fable 5、Mythos 5 と比較してどうですか?
Anthropic の公式の立場によれば、次のように理解できます。
| モデル | より良いポジショニング | 公式比較における重要な情報 |
|---|---|---|
| クロード作品4.8 | すでに安定して実行されている既存の Opus ワークロード | Opus 5 は同じ基本単価を維持し、複数の機能を向上させています。 |
| クロード作品5 | 高難易度総合エージェント、プログラミング、科学研究、ツール操作 | Fable 5 の最先端インテリジェンスに約半額で迫る |
| クロード寓話 5 | 最高の能力天井を追求するミッション | CursorBench 3.2 ではまだわずかなリードを維持していますが、ミッションのコストは高くなります |
| クロード神話 5 | さらなる最先端のネットワーク セキュリティ機能 | 当局は、Opus 5 がネットワーク セキュリティの点で Mythos 5 より遅れていることを明らかにしました。 |
このチャートは、独自のテストに代わるものではありません。特に、「近い」や「リードしている」などの結論は、特定のベンチマーク、取り組みレベル、ツール環境に依存しており、すべてのビジネス シナリオにおける効果と直接同等に考えることはできません。
どのようなパフォーマンスの改善が正式に発表されましたか?
Anthropic は、エージェントのタスク、プログラミング、コンピューター操作、科学研究、視覚的出力をカバーする結果を公開しています。
1. エージェントと実際の作業タスク
Frontier-Bench v0.1 では、Opus 5 は Opus 4.8 のパフォーマンスを 2 倍以上上回り、タスクあたりのコストは低くなります。 Anthropic はまた、Opus 5 が Frontier-Bench と GDPval-AA で新たな最高の結果を達成したと述べました。
これらのベンチマークは、静的な質問に答えることよりも、タスク全体を完了することに重点を置いているため、エージェント アプリケーションにとって一定の参考値となります。ただし、実稼働環境では、失敗後の再試行回数も記録する必要があります。一度に 2 回の再試行を減らす高価なモデルの方が、最終的には安くなる可能性があるためです。
2. プログラミングとツールの使用法
CursorBench 3.2 の最高のエフォート設定では、Opus 5 は Fable 5 の最高の結果にわずか 0.5% 及ばず、タスクあたりのコストは約半分でした。
関係者らはまた、このモデルが複雑なツールチェーンを処理できる能力を強調した。クロード コード ワークフローを移行するときは、次の種類のタスクのテストに重点を置くことをお勧めします。
- 複数のファイルにわたるバグを追跡します。
- ログを読んだ後に根本原因を特定し、追加のテストを実行します。
- コードを変更した後、ビルド、テスト、フォーマット チェックを実行します。
- 実装を途中でコミットするのではなく、要件が不完全な場合に制約を特定します。
- 複数の MCP ツールを継続的に呼び出す必要がある運用プロセス。
3. コンピュータの操作と自動化
OSWorld 2.0 では、Opus 5 は同様のコストの他のモデルよりも優れたパフォーマンスを発揮しました。関係者らによると、コストは3分の1強で、フェイブル5の最高成績を上回ったという。
Zapier AutomationBench では、Opus 5 のスコアは、同じタスク コストで次に優れたモデルよりも約 1.5 倍高くなります。努力レベルが最も低くても、ほとんどのタスクを達成できました。
これは、低い労力レベルは必ずしも単純なチャットのためだけではないことを意味します。適切に構造化された自動化タスクの場合、トークンと遅延を制御するための実用的なオプションになる可能性があります。
4. 科学的研究と視覚的タスク
Anthropic によれば、Opus 5 はすべての生命科学テストにおいて Opus 4.8 を上回っています。このうち、内部有機化学評価は10.2ポイント増加し、タンパク質変異評価は7.7ポイント増加した。
さらに、Web ページ、スライドショー、およびモデルによって生成されるその他のビジュアルが改善されました。ただし、これらは依然として出版社によって提供されたレビューと例です。科学研究の結論、医療情報、または実験計画に関しては、手動によるレビューと情報源の検証を維持する必要があり、ベンチマーク スコアが高いことは事実の正確性を保証するものとみなされません。
Claude Opus 5 API の料金
Opus 5 の基本 API 価格は次のとおりです。
| プロジェクト | 価格 |
|---|---|
| トークンを入力 | $5 / 100万トークン |
| 出力トークン | $25 / 100万トークン |
| 高速モード | 基本料金の 2 倍 |
上記はリリースノートに記載されている基本価格です。キャッシュ、バッチ処理、またはクラウド プラットフォーム チャネルでは異なる請求ルールが採用される場合があり、正式な予算はその時点での呼び出し側チャネルの請求指示に基づく必要があることに注意してください。
リクエストの費用はおよそいくらですか?
長いタスクが累積的に使用すると仮定します。
- 100万トークンを入力します。
- 200,000 トークンを出力します。
デフォルト モデルの基本料金は次のとおりです。
|
|
同じトークンの使用量を Fast Mode の 2 倍のレートで計算すると、約 20 ドルになります。
実際のエージェントのタスクは、1 回の通話だけでは推定できません。より有用な指標は、「成功したタスクあたりのコスト」です。
|
|
安価なモデルが頻繁に再試行し、手動によるテイクオーバーが必要な場合、最終コストは Opus 5 よりも高くなる可能性があります。逆に、単純なタスクに Opus 5 を使用しても、十分なメリットが得られない可能性があります。
API を使用して Claude Opus 5 を呼び出す
curl の例
まず API キーを環境変数に入力してから、メッセージ API を呼び出します。実際のキーをスクリプトに書き込んだり、Git リポジトリにコミットしたりしないでください。
|
|
Windows PowerShell では、まず現在のセッション環境変数を設定します。
|
|
次に、Anthropic SDK を使用するか、現在の公式ドキュメントに従ってリクエストを作成します。環境変数は現在の PowerShell セッションに対してのみ有効であり、一時的なテストに適しています。
Python SDK の例
SDKをインストールします。
|
|
最小限の呼び出しスクリプトを作成します。
|
|
運用環境では、少なくとも以下を追加記録する必要があります。
- 要求されたモデル ID。
- 入力および出力トークン。
- 合計所要時間と最初のトークンの遅延。
- ツール呼び出しの数と失敗の理由。
- モデルのロールバックが発生するかどうか。
- 最終タスクを手動で引き継ぐかどうか。
単に HTTP 200 を記録するだけでは、プロキシ タスクの成功を判断するのに十分な尺度ではありません。
Fast Mode が適している場面
Opus 5 の高速モードはデフォルト モードより約 2.5 倍高速で、料金は基本料金の 2 倍です。このモードは Claude Platform で利用可能であり、使用クレジットを介して Claude Code でも利用できます。
最初に高速モードをテストするのに適したシナリオは次のとおりです。
- 開発者が待機しているインタラクティブなクロード コード セッション。
- 迅速な反復を必要とするオンライン事故分析。
- デモンストレーション、ペアプログラミング、リアルタイムツール操作;
- ビジネス価値に対する遅延の影響が単一トークンのコストよりも高いプロセス。
デフォルトで有効にするのに適さないシナリオは次のとおりです。
- 夜間のバッチ処理。
- キューに入れて実行できるオフライン コード レビュー。
- 大規模で優先度の低いデータの並べ替え。
- 料金上限と監視がまだ確立されていないエージェント サイクル。
高速モードに独立した予算タグを設定し、P50、P95 のレイテンシと成功したタスクあたりのコストを比較することをお勧めします。 「2.5 倍高速」という理由だけですべてのリクエストに対してこれをオンにしても、通常は最適なコスト構造にはなりません。
effort 設定の使い分け
Opus 5 には、インテリジェンス レベル、トークン使用量、レイテンシ、コストの間で選択できるさまざまな労力設定が用意されています。 Anthropic が公開したデータによると、部分的に自動化されたベンチマークでは低い労力でも依然として競争力がある一方、モデルの機能の上限に近づくには最高の労力の方が適していることが示されています。
階層化された戦略を使用できます。
| タスク | 推奨される開始点 | アップグレード条件 |
|---|---|---|
| フォーマット変換、固定ルール抽出 | 労力がかからない | フォーマットエラーまたは省略率が基準を超えています |
| 従来のコーディング、単一ウェアハウスのトラブルシューティング | 中程度の労力 | ツールを複数回呼び出した後、場所が見つからない |
| システム間障害、アーキテクチャ設計 | 高い労力 | タスク値は追加のトークンをカバーするのに十分です |
| 最先端の研究や難しいエージェントの評価 | 最大限の努力 | 必要な能力上限の検証| |
特定のパラメーター名と使用可能な範囲は SDK またはプラットフォームで更新される可能性があります。リクエスト フィールドはリリースに基づいて推測しないでください。アクセスする際は、使用するAPIバージョンの公式ドキュメントをご参照ください。
選び方:タスク複雑度で分ける
順序は次のように考えるとよい。
-
デフォルトは Sonnet 5 から
多くのコーディング、ドキュメント、Agent、企業自動化に向く。 -
明らかに複雑なら Opus 4.8 へ
長いコードベース、複数ツール、複数ステップ、安定実行と強い推論が必要な場面。 -
最高能力が必要なら Fable 5
高価値、長時間、失敗コストが高く、価格感度が低いタスク。 -
高スループット軽量タスクは Haiku 4.5
分類、抽出、要約、サポート、バッチ処理、低遅延対話。 -
Mythos 5 はアクセスがある場合のみ
一般開発者のデフォルト選択肢ではない。
移行とコストの二つの注意点
第一に、新しい Claude モデルは新 tokenizer を使う。Anthropic の文書では、Opus 4.7 以降の Opus、Fable 5、Mythos 5、Mythos Preview、Sonnet 5 では同じテキストがおよそ 30% 多い token になる可能性がある。コスト見積もりでは 100 万 token あたり単価だけを見てはいけない。
第二に、1M コンテキストがあるからといって毎回埋めるべきではない。Fable 5、Opus 4.8、Sonnet 5 は 1M token に対応するが、ツール呼び出し、キャッシュ、出力、多ターン Agent がコストを重ねる。実運用では次の方がよい。
- よく使うシステムプロンプトと長い背景には prompt caching を使う。
- 長文書は先に分割抽出し、高能力モデルに総合判断をさせる。
- 簡単なステップは Haiku や Sonnet に任せ、重要判断を Opus / Fable に上げる。
- 公式 benchmark だけでなく、実タスクの小さなサンプルで試す。
簡単な結論
現在の Claude ラインはかなり明確だ。
- Fable 5:最高能力。最も難しく価値の高いタスク向け。
- Opus 4.8:複雑な Agent コーディングと企業タスクの強力な選択肢。
- Sonnet 5:日常デフォルトに最適。能力、速度、価格のバランスがよい。
- Haiku 4.5:最速・最安。大規模な軽量タスク向け。
- Mythos 5:限定提供。通常の選択肢ではない。
製品や社内ワークフローで Claude モデルを選ぶなら、最高階層を追うのではなくタスクを分けるのが実用的だ。Haiku は軽量バッチ、Sonnet 5 はデフォルト実行層、Opus 4.8 は複雑な Agent と高難度コーディング、Fable 5 は最も難しく高価値な一部のタスクに残す。
モデルルーティングの提案
Claude モデル選定では、「ひとつのデフォルトモデル」だけにしない方がよい。軽量バッチは Haiku、日常コーディングと知識作業は Sonnet、複雑なリポジトリタスクと複数ステップ Agent は Opus、最高価値・最高難度のタスクは Fable に上げる、というルーティングが実用的だ。
ルールは最初は単純でよい。要約、分類、フィールド抽出は Haiku。PR review、文書生成、普通のコード修正は Sonnet。モジュール横断リファクタリング、インシデント振り返り、複雑な計画は Opus。Opus が連続して失敗するか、タスク価値が高い場合は Fable に渡す。
各階層には終了条件も必要だ。出力が不確実、ツール呼び出し失敗、テストが連続で通らない、コンテキストが閾値を超える、権限や本番データに関わる場合は、自動継続ではなく人間の確認を挟むべきだ。
コスト評価方法
モデル価格表は概算にすぎない。実コストはコンテキスト長、キャッシュヒット率、再試行回数、出力長、人間の手戻り時間で決まる。高価なモデルが一回で完了するなら、安いモデルを何度も再試行するより安い場合がある。
タスク種別ごとに、平均 token コスト、平均人間レビュー時間、失敗後に上位モデルへ上げる割合を記録するとよい。二週間ほど回すと、どのタスクを Sonnet に置き、どれを Opus や Fable に上げるべきか見えてくる。
参考資料: