記事一覧へ戻る
モデル評価

ProgramDistill、動作するWebアプリからコーディングAIを評価

読了目安 3 分

はじめに

これまでのソフトウェア工学向けベンチマークでは、課題文やissue、自然言語の指示によって望ましい変更内容を示す形式が一般的でした。しかし実際のWeb開発では、完成した製品を操作しながら、未完成のアプリケーションに不足している挙動を実装しなければならない場合があります。Microsoft ResearchのProgramDistillは、このような状況におけるコーディングエージェントの能力を測るために設計されました。

ベンチマークの仕組み

ProgramDistillでは、動作するアプリケーションを単なる参考画面ではなく、挙動を確認するための基準として扱います。研究チームはアプリケーションを異なる粒度の機能へ分解し、それぞれに繰り返し実行できる操作系列を関連付けました。対応するgold patchを使って挙動を再生できるため、機能が正しく成立しているかを実行ベースで検証できます。

自動化パイプラインのmine-craft-patchは、26個のアプリケーションから1,975件の再生検証済み挙動を発見し、人的な個別作業なしに4,063件のタスクを構築しました。インタラクティブなソフトウェアの複雑さを保ちながら、反復可能な評価に落とし込んでいる点が特徴です。

実験結果

9種類の最先端コーディングエージェントを評価した結果、完全なアプリケーション再構築における累積ワークフローの成功率は、GPT-6 Astraが49.2%、Claude Opus 5が28.8%でした。単一機能を実装できても、複数の関連操作を連続して成立させることは容易ではないことが分かります。

部分的なアプリケーション再構築では、復元深度を1から8へ増やすと、GPT-6 Astraの成功率は100%から64.0%へ、Claude Opus 5は96%から32%へ低下しました。これは、課題がコード生成だけではないことを示しています。エージェントは参考アプリを観察し、挙動間の依存関係を推測し、未完成のコードベースに一貫した変更を加える必要があります。

意義と今後

ProgramDistillは、暗黙的な要件の発見とインタラクティブな実装をSWE評価に持ち込みます。機能の粒度や復元深度を調整できるため、エージェントが挙動の発見、計画、実装のどこでつまずくのかを分析する土台になります。

また、タスクを自動生成できる設計は、評価セットの拡張や難易度別の訓練カリキュラムにもつながる可能性があります。一方、公開版は準備中であり、さまざまなアプリケーションにどこまで適用できるかは今後の検証を待つ必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
解けても理解しているとは限らない:推論モデルの体系性を検証
モデル評価
cctest.ai
モデル評価

解けても理解しているとは限らない:推論モデルの体系性を検証

新たな研究は、推論モデルが学習した規則を構造的に同値な課題へ移せるかを調べた。モデルは元の課題を解けても、要素の再結合や記号の置換を施した変形課題で失敗することが多かった。

続きを読む
CCTest · Blog
エージェントはなぜ遅くなるのか:Elo-per-tokenで見る推論時戦略
モデル評価
cctest.ai
モデル評価

エージェントはなぜ遅くなるのか:Elo-per-tokenで見る推論時戦略

LLMエージェントは推論中に解答を修正し、ツールを使い、別の可能性を探索できる。しかし、Tokenを増やせば性能が同じ割合で伸び続けるわけではない。新研究は、性能向上が鈍化する地点を「Elo-per-token」で分析した。

続きを読む