RealSWE:現実の依頼で変わるコーディングエージェント評価
はじめに
コーディングエージェントは、実際の開発者が送る依頼を解いているのでしょうか。それとも、情報が整理されたベンチマーク課題に対応しているのでしょうか。RealSWEはこの差を調べるため、日常的なユーザー依頼とSWE-bench系ベンチマークの問題文を比較しました。ベンチマークの課題は長く、形式的で、必要な情報がそろっていることが多いのに対し、現実の依頼は短く、くだけた表現で、説明が足りない場合があります。
明らかになった入力の差
研究チームは情報を六つのカテゴリーに分類し、SWE-chatの実際のプロンプトと、SWE-bench VerifiedおよびProの問題文を分析しました。さらに、言語スタイルを四つの側面から調べています。主な結果は次の通りです。
- 問題の説明だけ、または少しの文脈だけを含む依頼は、現実のプロンプトの88%を占めます。一方、ベンチマーク課題では7%にすぎません。
- 現実の依頼の87%はカジュアルな文体ですが、ベンチマーク問題の94%はフォーマルな文体です。
- RealSWEは381の多変種タスク族で構成されます。同じ基礎タスクと正解パッチを保ちながら、情報の組み合わせと言語スタイルだけを変えます。
- 七つの現代的な大規模言語モデルを評価したところ、現実的な入力では平均解決率が6.4ポイント低下し、モデルの順位が変わる場合もありました。
何を伝えるべきか
実験は「情報は多いほどよい」という単純な見方を修正します。ソフトウェアが修正後にどう動くべきかという望ましい動作と、なぜ変更が必要なのかという動機を明示すると、モデルの性能に大きな影響が出ました。一方、環境情報や再現手順は入力を長くするだけで、報告された分析では測定可能な利益を示しませんでした。文体の影響も小さく、モデルによって異なります。
ユーザーにとっての実用的な示唆は、依頼を完全なチケット形式にすることではありません。短い依頼であっても、可能なら期待する結果と変更の目的を明確にすることが重要です。エージェントの開発者にとっては、整理された課題での高成績だけでは、日常の開発フローに適応できたとは判断できません。
評価への意味
RealSWEの意義は、入力条件とコード修正タスクを切り分けた点にあります。同じタスクと正解パッチに複数の入力変種を対応させることで、モデルが本当に曖昧な依頼に対応できているのか、それともベンチマークから手厚い情報を受け取っているだけなのかを調べられます。これはプロンプト設計、エージェントの対話画面、今後のベンチマーク設計に役立つ視点です。
もちろん、対象タスクはSWE-bench VerifiedとProから作られており、研究の焦点も情報構成と言語スタイルです。すべてのソフトウェア開発場面を代表する結論ではありません。それでも、現実の利用体験を評価するには、整えられた問題文だけでなく、ユーザーが実際にどのように依頼するかもテストする必要があります。
コメント
ログイン状態を確認中…
コメントを読み込み中…