記事一覧へ戻る
モデル評価

SWE-Bench ProMax:多言語の大規模リファクタリングでコードエージェントを評価

読了目安 3 分

導入

AI コーディングエージェントは、コード補完や小さな修正を超えて、より長期的で複雑なソフトウェア開発タスクへ進みつつあります。一方で、それを測るベンチマークには限界も見え始めています。SWE-Bench ProMax の論文は、既存の SWE-bench 系評価が急速に飽和しつつあるだけでなく、評価品質にも疑問があると指摘します。著者らが引用する監査では、SWE-bench Verified の未解決インスタンスの多くに、狭すぎるテストや、明示されていない要件まで確認する広すぎるテストが含まれていたとされています。

この問題意識から提案されたのが、より現実の開発に近いリファクタリング中心のベンチマーク、SWE-Bench ProMax です。

核心ポイント

  • バグ修正ではなくリファクタリングを対象にする:振る舞いを保ったまま、複数ファイルにまたがる整合的な変更を行えるかを評価します。
  • 7 つの言語をカバー:Python、Java、TypeScript、Go、C、C++、Rust を含み、単一言語に偏らない能力測定を目指しています。
  • 実際のコミットに基づく 170 件の課題:人工的な小問ではなく、現実のソフトウェア保守から得られた変更をもとにしています。
  • 専門家による多段階の精査:課題文は一から書き直され、要求が明確になるよう調整されています。テストスイートも手動で確認され、狭すぎるものや広すぎるものは取り除かれます。
  • 変更規模が大きい:各インスタンスは平均 11.4 ファイル、261.6 行の変更を含み、リポジトリ全体の理解を求めます。

意義と影響

実際のソフトウェア開発では、価値の高い作業が単一の失敗テストを直すだけとは限りません。API の移行、重複実装の整理、モジュール境界の変更、構造の改善など、機能を壊さずに設計を整える作業は頻繁に発生します。こうしたタスクでは、モデルがコード片だけでなく、プロジェクト全体の意図や依存関係を理解する必要があります。

また、SWE-Bench ProMax はベンチマーク設計におけるテスト品質の重要性を強調しています。テストが不正確であれば、ランキングは本来のエンジニアリング能力ではなく、偏った採点基準への適応を測ってしまう可能性があります。課題文とテストを丁寧に整備する姿勢は、今後のコードエージェント評価にとって重要な方向性です。

提供された素材には、具体的なモデル順位や性能比較の詳細は含まれていません。そのため現時点で注目すべきは、結果よりも評価設計です。コードエージェントが実際のリポジトリで働く段階に入るほど、ProMax のような大規模リファクタリング評価の重要性は高まるでしょう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ExplorationBench、未知の「異星世界」でAIの探索能力を測定
モデル評価
cctest.ai
モデル評価

ExplorationBench、未知の「異星世界」でAIの探索能力を測定

ExplorationBenchは、AIが未知の規則を実験によって発見したのか、それとも事前学習の記憶を呼び出しただけなのかを検証するためのベンチマークだ。実行可能で常識に反する仮想世界を用い、回答を厳密に確認する。

続きを読む
CCTest · Blog
ブラックボックスを開く:最先端モデルの隠れた推論を引き出す
モデル評価
cctest.ai
モデル評価

ブラックボックスを開く:最先端モデルの隠れた推論を引き出す

標準APIのカスタムツール呼び出しを使い、研究者が最先端モデルの中間推論の一部を外部化した。GPT-6 Astraは短く直線的な推論を示したが、可視化された記録だけで真の内部思考を証明することはできない。

続きを読む