記事一覧へ戻る
コーディングAI

WideSWE、コードエージェントのリポジトリ横断協調を検証

読了目安 3 分

導入

コードエージェントの評価は、単発のIssue修正から、より長期的な開発作業へと広がっています。しかし、多くのベンチマークはいまだに一つのリポジトリ内で課題を完結させます。現実のソフトウェア開発では、機能追加やバグ修正がコアライブラリ、クライアント、連携プロジェクト、テスト用リポジトリなどに同時に影響することがあります。一部だけを修正しても、局所的には正しそうなパッチが、エコシステム全体では動かない可能性があります。

WideSWEは、このリポジトリ横断の能力を測るための評価基盤です。研究チームは103のソフトウェアエコシステムにおける変更を収集・確認し、実際の開発に基づく120課題を作成しました。内訳はバグ修正60件、機能追加60件です。プロンプトは関連するIssueやPull Requestから導き、隠しテストも見直しました。これにより、複数の正しい実装を受け入れながら、必要な挙動と回帰チェックを維持しています。

主なポイント

  • 評価単位が単一リポジトリからエコシステムへ広がった。 エージェントは影響を受けるすべてのリポジトリを見つけ、互換性のある変更を連携させる必要があります。
  • 課題は修正と機能追加を均等に含む。 いずれも実際のソフトウェア変更をもとにしており、人工的な孤立問題に限定されません。
  • 完全達成率はまだ高くない。 7種類の設定で完全成功率は10.83%から42.50%。最高だったのはCodex CLIとGPT-5.6-solの組み合わせでした。
  • 失敗は実装能力だけの問題ではない。 必要なリポジトリを発見できない、作業を途中で止める、対象を変更しても要求された挙動を満たせない、といった問題が見られました。
  • 実行方式も結果に影響する。 リポジトリごとの独立実行は見落としの回収に役立ちましたが、すでに失敗した実装の修正には限界がありました。共同実行では、関連リポジトリの情報を実装や検証に利用できます。

意義と影響

WideSWEが示すのは、ローカルなコード編集者とソフトウェアエコシステム全体を扱う開発者の間に大きな差があることです。横断的な作業には、全体の変更計画、依存関係の理解、インターフェースの同期、複数プロジェクトをまたぐ検証が必要です。単一リポジトリの課題を単純に複数合わせたものではなく、各変更が他のプロジェクトに与える影響を把握しなければなりません。

この研究は、エージェントのワークフロー設計にも示唆を与えます。リポジトリを分離すれば実行管理は容易になりますが、計画やデバッグに必要な文脈を失う可能性があります。情報共有、継続的な状態管理、横断的な回帰検証を備えた仕組みが、複雑な開発にはより適していると考えられます。

Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Alibaba、制御性を重視したAIコードレビュー基盤OpenCodeReviewを公開
コーディングAI
cctest.ai
コーディングAI

Alibaba、制御性を重視したAIコードレビュー基盤OpenCodeReviewを公開

Alibabaが、Goで開発したAIコードレビューCLI「OpenCodeReview」をオープンソース化した。ファイル選択やルール照合を決定的な処理に任せ、コード分析にLLMエージェントを使う構成が特徴だ。

続きを読む
CCTest · Blog
一つから複数へ、そして一つへ:カテゴリ対応型SWEエージェント訓練
コーディングAI
cctest.ai
コーディングAI

一つから複数へ、そして一つへ:カテゴリ対応型SWEエージェント訓練

異質なソフトウェア工学タスクを一つの強化学習プールで訓練すると、カテゴリごとの改善に偏りや退行が生じることがあります。本研究は、RREでカテゴリ別専門家を育て、ラベル付きの多教師オンポリシー蒸留で一つのモデルへ統合します。

続きを読む
CCTest · Blog
CodeMidas、ソースコードそのものからコーディングAIの強化学習環境を構築
コーディングAI
cctest.ai
コーディングAI

CodeMidas、ソースコードそのものからコーディングAIの強化学習環境を構築

Xiaomi MiMoチームのCodeMidasは、既存のソースコードだけを入力として、機能の探索、実行可能なテストの作成、強化学習タスクの検証までを自動化する。実験では、修正、プログラム構築、ターミナル操作に関する複数のベンチマークで性能向上が報告された。

続きを読む