はじめに
2026年7月24日(米東部時間)、AnthropicがClaude Opusシリーズの新フラグシップモデル「Claude Opus 5」を発表した。APIモデルIDはclaude-opus-5、標準API価格は100万入力トークンあたり5ドル・同出力25ドル。これはOpus 4.8と完全に同一であり、同社最強モデルFable 5($10/$50)のちょうど半額にあたる。
Anthropicは今回の発表で「最も賢いモデル」という言葉を意図的に避け、代わりに「毎日使えるフロンティア級知能」というポジショニングを選択した。これは、AIモデル市場の競争軸が「絶対性能の頂点争い」から「単位コストあたりの実用性能」へと根本的にシフトしたことを示す、極めて重要なシグナルだ。
直近ではDeepSeek V4($0.87/100万出力トークン)、Google Gemini 3.6 Flash、OpenAI GPT-5.6 Terra/Lunaと、低価格・高性能モデルが相次いでいる。Anthropicはこの波に対して「値下げではなく、性能向上という形でコスパを実現する」戦略を取った。
1. Claude Opus 5のスペック──数字で見る進化
基本仕様
| 項目 | Claude Opus 5 | Claude Opus 4.8 |
|---|---|---|
| API ID | claude-opus-5 | claude-opus-4-8 |
| コンテキストウィンドウ | 100万トークン | 100万トークン |
| 最大同時出力 | 128,000トークン | 128,000トークン |
| 標準価格(入力/出力) | $5/$25 | $5/$25 |
| Fastモード価格 | $10/$50(約2.5倍速) | $10/$50 |
| バッチ価格 | $2.50/$12.50 | $2.50/$12.50 |
| 知識カットオフ | 2026年5月 | 2026年1月 |
| 思考(thinking) | デフォルトON | デフォルトOFF |
| 努力レベル | 5段階(low~max) | 4段階(~xhigh) |
競合価格比較(100万トークンあたり、USD)
- Claude Sonnet 5: $3/$15(導入価格$2/$10、8月31日まで)
- Claude Opus 5: $5/$25 ← 新登場
- Claude Fable 5: $10/$50
AnthropicはOpus 5を「Fable 5の半額でフロンティア級知能に迫る」と位置づける。実際、複数のベンチマークでOpus 5はFable 5の性能に肉薄し、一部では上回った。
2. ベンチマーク──衝撃の性能向上
コーディング・ターミナル操作
| ベンチマーク | Opus 5 | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| SWE-bench Pro | 79.2% | — | — | — |
| Frontier-Bench v0.1 | 43.3% | 21.1% | 33.7% | 34.4% |
| CursorBench 3.2 (max) | Fable 5 -0.5% | — | 最高 | — |
Frontier-Bench v0.1(エージェント型ターミナルコーディング)でOpus 5はOpus 4.8の2倍以上を達成。Fable 5やGPT-5.6 Solをも大幅に引き離した。CursorBench 3.2の最高努力(max)設定では、Fable 5のピーク性能と0.5%差まで迫り、1タスクあたりのコストは約半分だ。
未知問題解決(ARC-AGI-3)
| モデル | ARC-AGI-3 スコア |
|---|---|
| Claude Opus 5 | 30.2% |
| GPT-5.6 Sol | 7.8% |
| Claude Opus 4.8 | 1.5% |
最も衝撃的な数字がARC-AGI-3だ。人間が100%解ける抽象推論テストで、Opus 5は次点のGPT-5.6 Solの約4倍���Anthropic発表では「次善モデルの3倍」)を記録。Opus 4.8のわずか1.5%から20倍の飛躍である。
さらに、ARC Prizeの分析チームはOpus 5がこれまでに見られなかった挙動を示したと報告している──課題のレイアウトを自発的に代数記号に変換し、高度な論理推論を行っていたのだ。これは大規模言語モデルの「認知」と「抽象推論」の進化を観察する上で、極めて示唆に富む発見である。
知識作業・コンピュータ操作
- GDPval-AA v2(知識作業): Opus 5 1861 Elo(Fable 5: 1747)──知識集約型タスクでFable 5を明確に上回る
- OSWorld 2.0(コンピュータ操作): Opus 5がFable 5の最良スコアを約1/3のコストで上回る
- Zapier AutomationBench: 次点モデルの約1.5倍の合格率、同一コストで
科学研究
Anthropicの全社内ライフサイエンス評価でOpus 4.8を上回った:
- 有機化学・分光学: Opus 4.8比 +10.2ポイント
- タンパク質配列変異機能予測: +7.7ポイント
3. 自己検証能力──「考えるAI」から「自分をチェックするAI」へ
Anthropicの発表で最も印象的なのは、Opus 5の自己検証・反復能力の飛躍だ。
典型的な事例として、AnthropicはFrontier-Benchのタスクを紹介している。モデルは「機械部品の図面から3D FreeCADモデルを再構築せよ」と指示されたが、図面を直接見る能力を意図的に剥奪された状態でテストされた。
Opus 5は──
- 自らコンピュータビジョンパイプラインをゼロから記述し、生のピクセルデータから幾何情報を抽出
- 抽出した情報をもとにFreeCADモデルを完全に再構築
- 同条件で他の対照モデルは5回試行してもすべて失敗
この「手段を自ら考案する」能力は、エージェント型AIの実用化において極めて重要なマイルストーンだ。事前に用意されたツールがない状況で、自分でツールを作って課題を解決する──これはまさに「自律的AIエージェント」の定義に近い。
顧客のフィードバックも同様の方向を示す:
- Harvey���法律AI): Opus 5は低い推論設定でもOpus 4.8の最高設定相当の品質を達成し、平均トークン消費を26%削減
- Lovable(アプリ開発): 「試行間のばらつきが著しく小さい」──量産型開発ではピーク性能より安定性が重要
4. 安全性──最低のミスアライメントスコア
AnthropicはOpus 5の安全性についても詳細なデータを公開した。
自動行動監査
- ミスアライメント行動スコア: 2.3(Anthropicの測定史上最低)
- 欺瞞的行動の割合が最も低く、悪用への誘導耐性も最高水準
サイバーセキュリティ
- 脆弱性発見能力: Mythos 5に近い水準
- エクスプロイト開発能力: Mythos 5に「大幅に劣後」
- Anthropicの対応: ソースコード中の脆弱性発見は許可、バイナリスキャン・ペネトレーションテスト・エクスプロイト生成はブロック
- 安全分類器のトリガー頻度: Fable 5の約15%(「明らかに緩い」とAnthropic)
生物学リスク
- 自動化AI R&D閾値未満、生物学リスク評価CB-1
- ASL-3デプロイメント保護下で運用
- 長期自律��究タスクでは依然として限界あり → Mythos 5がこの用途では優位
5. 二つの新機能(ベータ)
Opus 5と同時に2つのベータ機能がリリースされた:
- 会話途中のツール変更(Claude Platform): 会話の途中で利用可能ツールを変更しても、プロンプトキャッシュが無効化されない。エージェントワークフローの柔軟性が大幅向上。
- 自動フォールバック(API): 安全分類器でフラグされたリクエストを、ブロックする代わりに他モデルへ自動ルーティング。デフォルトで最適モデルへ転送され、Opus 4.8が標準のフォールバック先。
6. 市場へのインパクト──「コスパ戦争」の新段階
Claude Opus 5の発表は、2026年7月現在のAIモデル市場における重要な転換を示している。
競争構造の変化
7月上旬から中旬にかけて、OpenAI(GPT-5.6シリーズ: Sol/Terra/Luna)、Google DeepMind(Gemini 3.6 Flash・3.5 Flash-Lite・Cyber)、xAI(Grok 4.5)、Meta(Muse Spark 1.1)と各社がフラッグシップモデルを投入してきた。いずれも「ベンチマーク首位」を競ってきたが、AnthropicはOpus 5で別の軸を選んだ。
「最大性能」ではなく「日常的に使える最高の性能」──Fable 5の半額で、ほとんどのタスクにおいて実用上十分な性能を提供する。これは、企業や開発者が「高いか��特別な時だけ使う」モデルと「安いから普段使いする」モデルを分ける必要が、急速になくなることを意味する。
Anthropicの製品ピラミッド(2026年7月現在)
| 層 | モデル | 価格(入出力) | 位置づけ |
|---|---|---|---|
| Mythos | Mythos 5 | 制限公開 | サイバー防衛・国家安全保障 |
| Fable | Fable 5 | $10/$50 | 絶対的な性能上限 |
| ★ Opus | Opus 5 ← NEW | $5/$25 | 日常使いの最高性能 |
| Sonnet | Sonnet 5 | $3/$15(導入$2/$10) | 高ボリューム・低コスト |
| Haiku | Haiku 4.5 | 最安 | 軽量・高速 |
Opus 5はClaude Maxのデフォルトモデル、Claude Proの最強モデルとして即日利用可能。Amazon Bedrock、Google Vertex AI、Microsoft Foundryでも提供される。
おわりに
Claude Opus 5は、「AIモデル戦争」が新たなフェーズに入ったことを示す象徴的なリリースだ。各社の旗艦モデルが絶対性能で拮抗しつつある2026年半ば、Anthropicは価格を据え置いたまま性能を倍増させるという最も実務的な回答を出した。
「フロンティア級の知能を、フロンティア級の価格ではなく日常の価格で」──このメッセージは、AIを「特別な道具」から「当たり前のインフラ」へと変える、静かだが決定的な一歩である。
今回のリリースで特筆すべきは、Anthropicが「最強」を主張しなかったことだ。Fable 5の地位は揺るがさず、代わりにOpus 5を「毎日使うモデル」として定義した。これはSam Altmanの「モデルは商品化する」という予言を裏付ける動きでもある。AIの価値がモデルそのものから、そのモデルを使ったソリューションとワークフローへと移行しているのだ。
本記事は、Anthropic公式発表(2026年7月24日)、Claude Opus 5 System Card(193ページ)、各種第三者分析(kingy.ai、aireiter.com、digitalapplied.com、AIHub)に基づいて作成。ベンチマーク数値はすべてメーカー公表値であり、今後の第三者検証により変動する可能性がある。