Claude Opus 5登場:Fable 5に半額級で迫る新モデル
導入
AnthropicがClaude Opus 5を正式に公開した。話題の中心は、Fable 5の約半額とされる価格で、複数の高難度評価において同等またはそれ以上の結果を出している点だ。ただし今回の本質は、単なる「安くて強いモデル」ではない。素材にある開発者テストや公式事例を見ると、Opus 5は生成だけでなく、検証手順を組み立て、自分の出力を測る能力を前面に出している。
重要ポイント
- 価格据え置きで性能を引き上げた。 Opus 5は入力100万トークン5ドル、出力100万トークン25ドルで、Fable 5の約半分とされる。Frontier-Bench v0.1では43.3%を記録し、Fable 5の33.7%、前世代Opus 4.8の21.1%を上回った。
- 複雑なコード生成デモが相次いだ。 Rocket League風ゲーム、スキー場面、Minecraft風の再現、1945年から2055年まで変化する街区の単一HTML、アポロ打ち上げ場面など、視覚表現とインタラクションを伴う作例が多数報告された。
- 自己検証の姿勢が目立つ。 ボーイング747の3D再構築テストでは、Opus 5はブラウザ上のモデル生成に加え、レンダリング画像から輪郭を抽出し、翼幅やホイールベース、主翼前縁の後退角などを公開データと照合する測定スクリプトまで作った。
- Claude Codeのプロンプトも大幅に簡素化。 Anthropicによれば、Opus 5やFable 5世代に合わせてClaude Codeのシステムプロンプトを80%以上削減しても、コーディング評価は低下しなかった。固定的な「コメントを書かない」規則は、周囲のコードスタイルに合わせる柔軟な方針へ置き換えられた。
意味と影響
Opus 5が示しているのは、モデルが「指示に従って生成する存在」から「目的に向けて工程を管理する存在」へ近づいているということだ。ツールをいつ使うか、記憶をいつ残すか、検証環境をいつ作るかをモデル側が判断できれば、人間が長大なシステムプロンプトで細かく縛る必要は減っていく。
特にコーディングAIでは、この差が大きい。今後の競争は、美しいデモを一回で出せるかだけではなく、結果をどう検証し、実要件に合っていると証明できるかに移る。Opus 5にはさらなる独立検証が必要だが、今回の事例はAI開発競争の焦点が「生成力」から「工程の自律性」へ広がっていることを示している。
出典:量子位
コメント
ログイン状態を確認中…
コメントを読み込み中…