コンテンツにスキップ

Claude Opus 5ベンチマーク比較:Fable 5とGPT-5.6 Solとの差を数値で読む

7月25日時点の比較判断

読めること数値だけでは読めないこと
総合指数は61対60対59で僅差1点差を実務上の明確な優劣とは断定できない
Opus 5は専門業務で100 Elo超先行自社タスクでも同じ差が再現する保証はない
Fable 5比のリスト単価は50%低い独立評価のタスク単価差は26%に縮む
Opus 5とFable 5はフォールバック込み両モデル単体の純粋な差は公開値から分離できない

Anthropicは2026年7月24日、Claude Opus 5を公開した。 訴求は「Fable 5に近い知能を半額で」で、API単価は入力100万トークン当たり5米ドル、出力25米ドルである。1

翌日までにArtificial Analysisの独立評価も公開された。 結論は単純な「半額で同等」ではない。 総合指数は僅差だが、専門業務ではOpus 5が先行し、実測タスク単価の差は26%にとどまる。

3モデルの比較軸

総合指数の1点差より専門業務の100 Elo差が大きい

Artificial Analysis Intelligence Index v4.1では、Opus 5のmax effortが61、Fable 5が60、GPT-5.6 Solが59だった。 この指数はGDPval-AA v2、Terminal-Bench v2.1、Humanity's Last Examなど9評価を合成する。23

独立評価Opus 5Fable 5GPT-5.6 Sol
Intelligence Index v4.1616059
GDPval-AA v2(Elo)1,8611,7471,736
AA-Briefcase(Elo)1,720約1,574公表比較なし

GDPval-AA v2では、Opus 5がFable 5を114 Elo、Solを125 Elo上回った。 AA-BriefcaseでもFable 5との差は146 Eloだった。2

Intelligence Indexの1点差は、幅広い能力を平均した結果である。 GDPval-AA v2とAA-Briefcaseは、資料やツールを使って専門職の成果物を作るタスクへ寄せている。 したがって公開値からは、一般知能の明確な序列より、エージェント型の専門業務でOpus 5が強かったと読むほうが正確だ。

ただし、Opus 5の事実知識には別の弱点が出た。 Artificial Analysisによると、AA-Omniscienceの知識精度はOpus 4.8より7ポイント上がった一方、幻覚率は14ポイント増えて50%になった。2 専門業務のEloが高いことは、未確認の事実を安全に答える保証ではない。

リスト価格50%減はタスク単価26%減に縮む

Opus 5とFable 5のAPI単価は、きれいな2対1である。14

100万トークン当たりOpus 5Fable 5GPT-5.6 Sol
入力$5$10$5
出力$25$50$30

しかしArtificial AnalysisのIndex評価では、1タスク当たりの平均費用はOpus 5が2.03米ドル、Fable 5が2.75米ドルだった。 削減率は約26%で、リスト単価の50%より小さい。2

差が縮む理由は、請求額が単価だけで決まらないからだ。 思考と回答の出力、入力、キャッシュ書き込み、キャッシュヒットを合算すると、同じ評価でもモデルごとのトークン量が効く。 Artificial Analysisは、Opus 5のlowからmaxまででGDPval-AA v2の出力トークン量が約8倍変わると報告している。2

したがって「Fable 5から替えれば請求額が半分になる」とは見積もれない。 移行判断では、同じ受け入れ条件を満たすまでの総トークン、再試行回数、完了時間を測る必要がある。

effortは知能だけでなく待ち時間と出力量を変える

Opus 5にはlow、medium、high、xhigh、maxの5段階がある。 Artificial Analysisでは、Indexがlowの51からmaxの61まで伸び、評価全体の出力は12Mから100Mトークンへ増えた。2

公開直後の速度とTTFTは短い時間にも更新されている。 7月25日のArtificial Analysis各モデルページでは、取得時刻によってxhighのTTFTが37秒台から39秒台まで動いた。 このため固定値の表を運用SLAとして使うべきではない。

変わらない判断材料は、xhighとmaxで初回応答まで数十秒を要するという傾向である。 対話型UIではlowかmediumから始め、品質不足が確認されたタスクだけeffortを上げる設計が合う。 Fast modeは別のレバーで、標準の約2.5倍速を基本価格の2倍で提供する。1

ベンダー公表値は独立評価と分けて読む

Anthropicの公表値では、Opus 5はFrontier-Bench v0.1で43.3%だった。 Fable 5は33.7%、GPT-5.6 Solは34.4%、Opus 4.8は18.7%と報じられている。15

ARC-AGI 3ではOpus 5が30.2%、Solが7.8%だった。 ただしFable 5は評価対象に含まれていないため、この結果からOpus 5とFable 5の優劣は決められない。5

AnthropicはCursorBench 3.2でFable 5のピークから0.5%以内と説明する。 Zapier AutomationBenchでは同一コストの次点比約1.5倍、 OSWorld 2.0ではFable 5の最良結果を約3分の1のコストで上回ったとする。1 いずれも有力な導入候補を示すが、評価主体または発表主体はAnthropicか協力企業である。 独立評価と同じ証拠の強さでは扱わない。

フォールバックは両Claudeモデルの評価条件に含まれる

Fable 5の公開スコアだけがOpus 4.8との複合構成なのではない。 Artificial Analysisは、Opus 5のIntelligence Index評価でもOpus 4.8へのサーバー側フォールバックを有効にしたと明記している。2

AnthropicのFrontier-Bench脚注も、Opus 5とFable 5の双方で、安全分類器が拒否した場合のフォールバック先にOpus 4.8を使ったとする。 同評価はmini-SWE-agentとGKEを使った社内実行で、1タスク5試行の平均報酬である。1

したがって公開スコアは、厳密には次の比較になる。

  • Opus 5とOpus 4.8フォールバックの構成
  • Fable 5とOpus 4.8フォールバックの構成
  • GPT-5.6 Solの評価構成

両Claudeモデルに同じフォールバック先があることは、影響が相殺されたことを意味しない。 発生率と対象タスクが違えば、各スコアへの影響も変わる。 公開値だけから、フォールバックを除いたモデル単体の差は算出できない。

セーフガードはFable 5より日常業務へ寄せられた

Opus 5はソースコードからの脆弱性発見を許可する一方、バイナリを使う脆弱性スキャン、ペネトレーションテスト、エクスプロイト生成をブロックする。 Anthropicは、分類器の介入がFable 5より約85%少ないと見積もる。16

Claude.ai、Claude Code、Claude Coworkでは、フラグの立った要求が既定でOpus 4.8へ回る。 APIは自動フォールバックをオプトインでき、無効ならブロックする。 CVP参加者には制限を緩めた構成が提供される。1

生物学関連では、Fable 5でブロックされた要求の転送先がOpus 4.8からOpus 5へ変わった。 Opus 5自身の一般利用には、Fable 5のような追加のデータ保持要件はない。1

導入判断は3つの境界で分ける

  1. Opus 4.8利用者は同価格で比較する。 Indexは56から61へ上がり、AnthropicのFrontier-Bench公表値も18.7%から43.3%へ伸びた。 既存の回帰テストを通せるなら、有力な更新先になる。
  2. Fable 5利用者は半額ではなくタスク単価で比べる。 独立評価の差は26%であり、長時間タスクの成功率と再試行まで含めて測る。
  3. Sol利用者は専門業務と対話待ち時間を分ける。 Indexは61対59、GDPval-AA v2は125 Elo差だが、 Opus 5の高effortは対話用途で待ち時間が長い。

比較セットには、自社の代表タスクを20件以上入れる。 合格率、合格までの費用、完了時間、フォールバック発生の4項目を記録すれば、公開ベンチマークを運用判断へ変換できる。

関連記事


  1. Anthropic, Introducing Claude Opus 5, 2026-07-24. 

  2. Artificial Analysis, Opus 5: Fable 5 level intelligence at a lower cost per task, 2026-07-24. 

  3. Artificial Analysis, Intelligence Benchmarking methodology, 2026-07-25参照. 

  4. Anthropic, Models overview, 2026-07-25参照. 

  5. Decrypt, Claude Opus 5 Outscores Fable 5 on Most Benchmarks—At Half the Price, 2026-07-24. Frontier-BenchとARC-AGI 3の図中数値を確認する補助資料として使用. 

  6. Anthropic, Claude Opus 5 System Card, 2026-07-24.