評価結果は実際に何を証明できるのか
Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。
続きを読むInspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。
続きを読むUrbanGroundは、香港全域の3D地理空間データからインタラクティブな都市サンドボックスを構築し、局所的な視覚理解が長距離ナビゲーションに結び付くかを検証する。現在のMLLMは近距離の認識には強い一方、探索が長くなると方向維持や修正に課題を残す。
続きを読むFIRM-Videoは、動画生成の報酬モデルに「採点する前に確認する」チェックリスト型の評価手順を導入する。指示追従、世界の一貫性、知覚品質を個別に検証し、90K規模のデータセットとベンチマークを構築した。
続きを読むVideo-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。
続きを読むAnTrapは、解決可能なAndroidタスクの実行途中に現実的な実行時異常を注入し、GUIエージェントの頑健性を評価する。調査では多くのモデルで性能が低下し、学習で修正できる罠と、深い推論限界に由来する失敗が分かれた。
続きを読むVGI-Benchは、動画生成モデルを画質だけでなく、変化する視覚プロセスの論理に基づいて評価する。現在のモデルには一定の推論能力がある一方、信頼性には大きな課題が残ることが示された。
続きを読むGoogle DeepMindは外部機関とともに、モデルの重みと評価用プロンプトを相互に見せない「二重盲検」AI評価を試験導入する。機密コンピューティングでベンチマーク汚染のリスク低減を目指す。
続きを読む新たなベンチマークは、局所的なバグ修正ではなく、リポジトリ全体の技術スタック移行能力を測定する。520回の実行で、移行・動作・追加検証をすべて通過したのは5.4%にとどまった。
続きを読むFrontierChallengeは、もっともらしい回答ではなく、検証可能な科学ワークフローを最後まで納品できるかを評価する。結果は、部分的な進捗と完全な完了の間に大きな差があることを示した。
続きを読むClawProBenchは最終回答だけでなく、証拠の取得、ランタイムへのルーティング、安全境界、反復実行の安定性まで評価する。結果は、ネイティブなランタイム作業の難しさと、一度の成功では信頼性を測れないことを示した。
続きを読むThinkingboxは、妥当な返答やツール呼び出しだけでなく、業務ワークフロー終了時のバックエンド状態まで検証するサンドボックスです。ベンチマークは、偶然の成功と安定した実行能力の間に大きな差があることを示します。
続きを読むGameXpert-Benchは、コーディングエージェントのゲーム開発能力を、生成・バグ修正・多段階最適化の全工程で評価する。エージェントは遊べる土台の構築には強い一方、能動的な不具合発見や実行時検証、回帰の防止には課題を残す。
続きを読むMobilePA-Benchは、画面操作だけでなく、ツール呼び出し、長期計画、メモリ、スキル、サブエージェント協調を評価するインタラクティブなベンチマークです。権限制限や実行時エラーが加わると、最先端LLMの信頼性が大きく低下することを示します。
続きを読むLongRCA Benchは、長期実行エージェントの失敗分析を、責任を負う役割の特定と、最も早い決定的な根本原因ステップの特定に分けて評価する。1,140件の実際の失敗軌跡を用い、訓練不要のRCTA手法も検証した。
続きを読むモデルやプロンプト、検索設定を固定しても、検索インデックスを拡張すると同じ質問への回答が変わる可能性がある。新しい研究は、通常の生成揺らぎとインデックス更新による変化を分離する「スナップショット互換性監査」を提案した。
続きを読むFlavourBenchは、8種類の食材から3種類を選ぶ組み合わせ課題を通じて、オープンエンドな言語モデルを評価する。全56通りの候補を事前に採点する料理システムにより、判定の再現性を高めた。
続きを読む新しい研究は、ハイブリッド思考型マルチモーダルモデルにおいて、思考モードと非思考モードの応答行動に大きな差があると指摘した。PatternEvalとPatternRLにより、正答率だけでは捉えにくい失敗を評価・低減する。
続きを読むHume AIの研究は、自動音声認識モデルが公開ベンチマークの正解文を再現する傾向を測定する手法を示した。音声が矛盾、欠落、曖昧さを含む場合でも、正解文をそのまま出力する高スコアのオープンモデルが確認されたという。
続きを読むNARUは、日本語の長時間動画を対象に、物語の展開を追跡する能力と、明示されない文化的意味を推論する能力を同時に測るベンチマークです。既存のマルチモーダルモデルには、遠く離れた出来事の統合と文化的文脈に基づく推論に課題が残されています。
続きを読むコーディングエージェントの成否は、モデルがどんなコマンドを生成したかだけでなく、その出力が実行前にどうシリアライズ、ラップ、再解析されたかにも左右されます。QuoteBenchは、単一の一致スコアでは見えない実行経路の問題を測定しました。
続きを読むギリシャ語での推論実験は、正答率がほぼ変わらなくても、モデルの行動が大きく変わり得ることを示した。SFTはユーザーの言語で考える習慣を作り、RLVRは形式違反やチャネル漏洩を修正する。
続きを読む