記事一覧へ戻る
モデル評価

RealSWE:現実の依頼で変わるコーディングエージェント評価

読了目安 3 分

はじめに

コーディングエージェントは、実際の開発者が送る依頼を解いているのでしょうか。それとも、情報が整理されたベンチマーク課題に対応しているのでしょうか。RealSWEはこの差を調べるため、日常的なユーザー依頼とSWE-bench系ベンチマークの問題文を比較しました。ベンチマークの課題は長く、形式的で、必要な情報がそろっていることが多いのに対し、現実の依頼は短く、くだけた表現で、説明が足りない場合があります。

明らかになった入力の差

研究チームは情報を六つのカテゴリーに分類し、SWE-chatの実際のプロンプトと、SWE-bench VerifiedおよびProの問題文を分析しました。さらに、言語スタイルを四つの側面から調べています。主な結果は次の通りです。

  • 問題の説明だけ、または少しの文脈だけを含む依頼は、現実のプロンプトの88%を占めます。一方、ベンチマーク課題では7%にすぎません。
  • 現実の依頼の87%はカジュアルな文体ですが、ベンチマーク問題の94%はフォーマルな文体です。
  • RealSWEは381の多変種タスク族で構成されます。同じ基礎タスクと正解パッチを保ちながら、情報の組み合わせと言語スタイルだけを変えます。
  • 七つの現代的な大規模言語モデルを評価したところ、現実的な入力では平均解決率が6.4ポイント低下し、モデルの順位が変わる場合もありました。

何を伝えるべきか

実験は「情報は多いほどよい」という単純な見方を修正します。ソフトウェアが修正後にどう動くべきかという望ましい動作と、なぜ変更が必要なのかという動機を明示すると、モデルの性能に大きな影響が出ました。一方、環境情報や再現手順は入力を長くするだけで、報告された分析では測定可能な利益を示しませんでした。文体の影響も小さく、モデルによって異なります。

ユーザーにとっての実用的な示唆は、依頼を完全なチケット形式にすることではありません。短い依頼であっても、可能なら期待する結果と変更の目的を明確にすることが重要です。エージェントの開発者にとっては、整理された課題での高成績だけでは、日常の開発フローに適応できたとは判断できません。

評価への意味

RealSWEの意義は、入力条件とコード修正タスクを切り分けた点にあります。同じタスクと正解パッチに複数の入力変種を対応させることで、モデルが本当に曖昧な依頼に対応できているのか、それともベンチマークから手厚い情報を受け取っているだけなのかを調べられます。これはプロンプト設計、エージェントの対話画面、今後のベンチマーク設計に役立つ視点です。

もちろん、対象タスクはSWE-bench VerifiedとProから作られており、研究の焦点も情報構成と言語スタイルです。すべてのソフトウェア開発場面を代表する結論ではありません。それでも、現実の利用体験を評価するには、整えられた問題文だけでなく、ユーザーが実際にどのように依頼するかもテストする必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
EarlyEval、途中経過からエージェント評価を早期終了
モデル評価
cctest.ai
モデル評価

EarlyEval、途中経過からエージェント評価を早期終了

EarlyEvalは、LLMエージェントの実行途中に現れる行動やテキストの特徴から、タスクの成功・失敗を早期に予測する。3つのベンチマークで、評価結果への影響を抑えながら実行ステップとトークン使用量を削減した。

続きを読む
CCTest · Blog
AgentJudgeBench、ツール呼び出しエージェントを評価するLLMの信頼性を検証
モデル評価
cctest.ai
モデル評価

AgentJudgeBench、ツール呼び出しエージェントを評価するLLMの信頼性を検証

AgentJudgeBenchは、自由形式の文章評価ではなく、依存関係を持つツール呼び出しワークフローでLLM評価者を検証する。結果は、評価の限界がモデル規模よりもタスク難度に強く左右されることを示した。

続きを読む