Claude Opus 5提供開始、Fable 5に迫る性能で半額―エージェント用途の判断力とタスク完遂力を向上、GPT-5.6 Sol投入から2週間 | GameBusiness.jp

Claude Opus 5提供開始、Fable 5に迫る性能で半額―エージェント用途の判断力とタスク完遂力を向上、GPT-5.6 Sol投入から2週間

Anthropicは7月24日、待望の新AIモデル「Claude Opus 5」の提供を開始しました。すでに全プラットフォームで利用できます。

企業動向 その他
Claude Opus 5提供開始、Fable 5に迫る性能で半額 エージェント用途の判断力とタスク完遂力を向上、GPT-5.6 Sol投入から2週間
  • Claude Opus 5提供開始、Fable 5に迫る性能で半額 エージェント用途の判断力とタスク完遂力を向上、GPT-5.6 Sol投入から2週間
  • Claude Opus 5提供開始、Fable 5に迫る性能で半額 エージェント用途の判断力とタスク完遂力を向上、GPT-5.6 Sol投入から2週間
  • Claude Opus 5提供開始、Fable 5に迫る性能で半額 エージェント用途の判断力とタスク完遂力を向上、GPT-5.6 Sol投入から2週間

Anthropicは7月24日、新AIモデル「Claude Opus 5」の提供を開始しました。すでに全プラットフォームで利用できます。

Opus 5は、Mythosとともに大きな話題となってきたFable 5に迫る、分野によっては超える高性能でありながらコストは半額、従来のOpus 4.8から据え置きの高コスパが特徴のモデル。

特にエージェント用途で重要となる自律的な判断能力、自己評価しつつタスクを最後まで完遂する能力に重点を置いています。

Claude Maxでは新しい標準モデルとなり、Claude Proでもサブスク内で使える最上位モデルとなります。

■ コーティングや知識労働ベンチは最高水準

Anthropicによれば、Opus 5はコーディング用途や知識労働の評価であるFrontier-Bench、GDPval-AAで最高水準に達する一方、サイバーセキュリティの課題ではMythos 5よりも下の性能です。

分野によっては Fable 5を大きく上回る結果もあり、AIが未知の環境に適応する力を測るARC-AGI-3ベンチマークでは、これまで未踏だった5つの環境を新たに攻略、Fable系モデルの約20%に対し30.2%を記録しました。PC操作を評価するOSWorld 2.0でも、どのコスト水準でもFable 5の最高値を上回りながら、達成コストは3分の1強に留まっています。

Anthropic が数値以上に強調するのは、エージェント的用途で重要となる判断力と、タスクを最後までやり切る完遂力が向上したこと。自分の作業を検証しつつ反復することで、本当は直っていないのに完了しました!と報告するパターンが減るとしています。

判断力としては、指示へ単純に従うのではなく、タスクの目的に照らして反論することも。発表文では、提案された設計にそのまま従わず押し返してより良い設計を示した例、図面を直接参照できない制約を自前の画像処理パイプラインを書いて回避した例などを挙げています。

公開したベンチマークの多くは絶対スコアではなく、思考量を調整するeffort設定ごとのコスト対性能を示すグラフ。前世代のOpus 4.8に続き、最高性能よりも価格あたりの成果を強調する見せ方です。競合のOpenAIも、7月9日に一般提供を開始したGPT-5.6 Solではトークン効率の改善を前面にアピールしていました。

性能については、分野ごとに「他のすべてのモデルを上回る」「次点のモデルの3倍」といった表現で最高級であることを主張するものの、比較対象は自社モデルを除き直接名指ししていません。

■主要ベンチマークの数値

Anthropicが公開したベンチマーク結果では、Frontier-Bench v0.1ではOpus 4.8の2倍を超えるスコアを、より低いタスク単価で達成しました。

CursorBench 3.2の最大effort設定では、Fable 5の最高スコアとの差が0.5%以内に収まり、タスク単価は半分。

コーディング以外の領域としては、新規の問題を解かせるARC-AGI 3では「次点のモデル」の3倍、業務タスクを最初から最後まで完遂できるかを測るZapier AutomationBenchでは同じタスク単価で次点の約1.5倍。

PC操作を評価するOSWorld 2.0では、Fable 5の最高値を3分の1強のコストで上回る結果です。

科学分野でも、ライフサイエンス系の社内評価は全項目でOpus 4.8を上回ります。分光データから分子構造を推定する有機化学の課題で10.2ポイント、タンパク質の配列変化が機能に与える影響の予測で7.7ポイントの改善が示されました。

■安全機構は「止める」から「振り替える」へ

同社によれば、Opus 5はこれまでで最もアラインメントの取れたモデルであり、不整合行動のスコアは2.3。

デュアルユース能力についてはフロンティアを進めていないとして、生物学と攻撃的サイバーの双方でMythos 5に及ばないと説明しています。

運用面では、サイバー系の分類器が介入する頻度はFable 5比で約85%減少する見込み。

ソースコードの脆弱性発見は許可する一方、バイナリを対象としたスキャン、侵入テスト、エクスプロイトの生成はブロックし、対象となった要求はOpus 4.8へ自動的に振り替えます。

生物学関連でFable 5がブロックする要求も、今後はOpus 4.8ではなくOpus 5に回ります。

■価格と提供

価格は100万トークンあたり入力5ドル、出力25ドルで、Opus 4.8と同額です。APIのモデル名はclaude-opus-5。通常の約2.5倍の速度で動作するFastモードは、基本価格の2倍で利用できます。

同時に、2つの新機能をベータで提供します。ひとつは会話の途中で使えるツールを変更してもプロンプトキャッシュが無効にならない機能、もうひとつは安全分類器でフラグが立った要求を別のモデルへ自動的に振り分けるAPIの機能です。従来のOpusモデルと同様、一般提供分にデータ保持の要件はありません。

Claude Opus 5提供開始、Fable 5に迫る性能で半額 エージェント用途の判断力とタスク完遂力を向上、GPT-5.6 Sol投入から2週間

《テクノエッジ編集部ピックアップ》

この記事の感想は?

  • いいね
  • 大好き
  • 驚いた
  • つまらない
  • かなしい
【注目の記事】[PR]

関連ニュース

特集

人気ニュースランキングや特集をお届け…メルマガ会員はこちら