WideSWE、コードエージェントのリポジトリ横断協調を検証
導入
コードエージェントの評価は、単発のIssue修正から、より長期的な開発作業へと広がっています。しかし、多くのベンチマークはいまだに一つのリポジトリ内で課題を完結させます。現実のソフトウェア開発では、機能追加やバグ修正がコアライブラリ、クライアント、連携プロジェクト、テスト用リポジトリなどに同時に影響することがあります。一部だけを修正しても、局所的には正しそうなパッチが、エコシステム全体では動かない可能性があります。
WideSWEは、このリポジトリ横断の能力を測るための評価基盤です。研究チームは103のソフトウェアエコシステムにおける変更を収集・確認し、実際の開発に基づく120課題を作成しました。内訳はバグ修正60件、機能追加60件です。プロンプトは関連するIssueやPull Requestから導き、隠しテストも見直しました。これにより、複数の正しい実装を受け入れながら、必要な挙動と回帰チェックを維持しています。
主なポイント
- 評価単位が単一リポジトリからエコシステムへ広がった。 エージェントは影響を受けるすべてのリポジトリを見つけ、互換性のある変更を連携させる必要があります。
- 課題は修正と機能追加を均等に含む。 いずれも実際のソフトウェア変更をもとにしており、人工的な孤立問題に限定されません。
- 完全達成率はまだ高くない。 7種類の設定で完全成功率は10.83%から42.50%。最高だったのはCodex CLIとGPT-5.6-solの組み合わせでした。
- 失敗は実装能力だけの問題ではない。 必要なリポジトリを発見できない、作業を途中で止める、対象を変更しても要求された挙動を満たせない、といった問題が見られました。
- 実行方式も結果に影響する。 リポジトリごとの独立実行は見落としの回収に役立ちましたが、すでに失敗した実装の修正には限界がありました。共同実行では、関連リポジトリの情報を実装や検証に利用できます。
意義と影響
WideSWEが示すのは、ローカルなコード編集者とソフトウェアエコシステム全体を扱う開発者の間に大きな差があることです。横断的な作業には、全体の変更計画、依存関係の理解、インターフェースの同期、複数プロジェクトをまたぐ検証が必要です。単一リポジトリの課題を単純に複数合わせたものではなく、各変更が他のプロジェクトに与える影響を把握しなければなりません。
この研究は、エージェントのワークフロー設計にも示唆を与えます。リポジトリを分離すれば実行管理は容易になりますが、計画やデバッグに必要な文脈を失う可能性があります。情報共有、継続的な状態管理、横断的な回帰検証を備えた仕組みが、複雑な開発にはより適していると考えられます。
コメント
ログイン状態を確認中…
コメントを読み込み中…