Harbor、80超のベンチマークを統合するエージェント評価基盤
Harbor Adaptersは80以上のエージェント向けベンチマークを共通基盤に接続し、Harbor-Indexはその中から高難度の82タスクを選定します。
続きを読むHarbor Adaptersは80以上のエージェント向けベンチマークを共通基盤に接続し、Harbor-Indexはその中から高難度の82タスクを選定します。
続きを読むPerfReasoningは、ハードウェア性能に関する直接推論と、分析用性能モデルのコード生成を分けて評価するベンチマークだ。結果は、もっともらしい説明を作る能力と、信頼できる性能モデルを構築する能力の間に大きな差があることを示した。
続きを読むHarvestBenchは、動物をひく代わりに燃料を支払って迂回するかという具体的な選択で、AIエージェントの安全性を測る。モデルごとの殺傷率には大きな差があり、道徳的な指示による影響も顕著だった。
続きを読む見た目が滑らかな生成動画でも、物体の数や位置関係、出来事の順序を誤っている可能性があります。VeriPhyはプロンプトを型付きの物理的義務へ変換し、根拠まで追跡できる判定を生成します。
続きを読む音声ブレイン・コンピューター・インターフェースは、データセットや語彙、評価指標が異なるため、研究結果を単純に比較できません。新たな開放語彙相互情報量(OVMI)は、解読精度とユーザーの言語をどれだけカバーできるかを同時に評価します。
続きを読む動画生成モデルは自然に見える動きを作れても、基本的な物理法則を守るとは限りません。Principia は、同じシーンにある物体同士の関係を使い、カメラ校正に依存せず物理的一貫性を評価します。
続きを読むAFAC2026には5027チーム、約2万人が参加し、市場分析、金融文書、実験自動化、長文Agentに取り組みました。競技内容は、金融AIの評価軸が単発の精度から実運用能力へ移っていることを示しています。
続きを読むExecRetrievalは、正しい実装とほぼ同じ見た目のバグ実装を同じ検索候補に入れ、コード検索モデルの機能的な識別能力を測定する。上位10件では正解を見つけられても、1位に置く能力には大きな差が残った。
続きを読むS³Gymは、LLMエージェントが自らの行動を試し、経験を評価し、その結果を次の意思決定に生かせるかを測る対話型ベンチマークです。実験では、改善効果がタスク構造と経験の保存方法に強く依存することが示されました。
続きを読む新たな研究は、専門知識の不足と実行能力の不足を切り分けるための知識ゲート型タスク構築プロトコルを提案した。知識アーティファクトの有無を厳密に比較し、一部のタスクで明確な依存関係を確認した一方、追加学習への効果までは主張していない。
続きを読むEarlyEvalは、LLMエージェントの実行途中に現れる行動やテキストの特徴から、タスクの成功・失敗を早期に予測する。3つのベンチマークで、評価結果への影響を抑えながら実行ステップとトークン使用量を削減した。
続きを読むSWE-benchの課題は形式的で情報量が多い一方、実際のユーザー依頼は短く、くだけていて、文脈も不足しがちです。RealSWEは、現実的な入力にすると平均解決率が下がり、モデル順位まで変わり得ることを示しました。
続きを読むE-Commerce Benchは、LLMエージェントに365日間、仕入れ交渉から販売、返品、資金管理までを担わせる評価基盤です。最終資産を増やす能力と、リスクを避ける能力は一致しないことが示されました。
続きを読むAgentJudgeBenchは、自由形式の文章評価ではなく、依存関係を持つツール呼び出しワークフローでLLM評価者を検証する。結果は、評価の限界がモデル規模よりもタスク難度に強く左右されることを示した。
続きを読むSpanCalib-VLMは、生成型の視覚言語モデルとマルチモーダル系列タグ付け器を組み合わせ、幻覚を含むテキスト範囲の特定と信頼度の校正を同時に目指す手法です。SHROOM-Visionsの英語評価分割で、検出範囲とスコアの信頼性を両立させました。
続きを読むFACE-Eval の研究は、モデルに届く嗜好手掛かりの場所と明示性が、思考連鎖の忠実性を大きく左右することを示した。ツールの返答や生の資料に埋め込まれた手掛かりは、推論文に現れないまま回答へ影響しやすい。
続きを読む1つのベンチマークスコアには、安全性だけでなく推論や知識理解の信号も混在し得ます。Ai2のBenchMIRTは、多次元項目反応理論によって設問単位でその内訳を分析します。
続きを読むEASELは、画像を理解するだけでなく、視覚的なフィードバックを使ってツール操作を継続的に修正できるかを評価する。中心課題は、参照画像に合わせてキャンバスを段階的に描くことだ。
続きを読むLoopArenaは、コーディングエージェントを動かす制御ループを切り出し、別のモデルが長期的なソフトウェア開発をどれだけ適切に導けるかを測定するベンチマークです。結果は、長期的で信頼できる制御が依然として難しいことを示しています。
続きを読む新しいベンチマーク「GMA」は、オープンソースプロジェクトを基にした7つのアプリと300のタスクで、単一操作から複数ステップのワークフローまでモバイルエージェントを検証する。タスクが複雑になるほど性能は大きく低下する一方、コンテキスト保持や状態追跡を含むハーネス設計が一部の難しいタスクを改善できることが示された。
続きを読むInspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。
続きを読む