ExtractBench:企業文書のスキーマ誘導抽出を測る新ベンチマーク
ExtractBench は、ユーザー定義スキーマに従って企業文書から構造化データを抽出するエージェントを評価するベンチマークです。値の正確性だけでなく、記録の完全性、根拠提示、コストも同時に測定します。
続きを読むExtractBench は、ユーザー定義スキーマに従って企業文書から構造化データを抽出するエージェントを評価するベンチマークです。値の正確性だけでなく、記録の完全性、根拠提示、コストも同時に測定します。
続きを読むSee2Think は、マルチモーダル大規模言語モデルが推論中に生成するスケッチや注釈、中間画像を本当に利用しているのかを検証する評価枠組みです。
続きを読むStealthBench は、自律型セキュリティエージェントを「脆弱性を見つけられるか」だけでなく、「痕跡やリスクを増やさずに実行できるか」で評価する。結果は、現行モデルに OPSEC 上の課題が残ることを示している。
続きを読むSecRespond は、侵害済みホストのフォレンジック調査、リスク特定、修復計画を AI エージェントに求める評価基準です。結果は、現行モデルが明示的なアラートには対応できても、静かな侵入の発見や完全な修復計画では苦戦することを示しています。
続きを読む新論文は、未発表論文の中心的な研究課題をAIエージェントに任せ、元の著者が評価する「シャドー評価」を提案した。結果は、現在のエージェントが工学的作業をこなせても、開かれた研究判断にはまだ弱いことを示している。
続きを読むDataPrep-Bench は、LLM、エージェント、データ中心ワークフローが訓練データをどれだけ有効に準備できるかを評価するベンチマークです。表面的な文章品質ではなく、下流の訓練効果を基準にしています。
続きを読むSceneActBench は、3Dシーンを説明するだけでなく、その中で正しく行動できるかを評価する新しいベンチマークです。画像や動画フレームを入力に、VLMエージェントの空間理解と行動生成を幾何指標で検証します。
続きを読む新しい論文は、単発タスクで高い性能を示すLLMでも、実際の対話で変化し続けるユーザー意図を追跡できるとは限らないと指摘する。著者らは既存の静的ベンチマークを動的な多ターン対話へ変換する評価枠組みを提案した。
続きを読むProVisE は、空間推論タスクを文字や座標だけで評価することの限界に注目する。画像生成モデルにピクセル上で印を付けたり線を描かせたりし、その視覚的回答を既存ベンチマークの採点形式へ変換する枠組みだ。
続きを読むTencent WorkBuddy Bench は、コード、Web、オフィス業務、セキュリティの4領域でコーディングエージェントを評価するベンチマークです。公開・再現可能でありながら、タスク構築によってデータ汚染への耐性を高めている点が特徴です。
続きを読むActiveVision は、マルチモーダル大規模言語モデルが一度見て答えるだけでなく、観察・推論・再観察を繰り返せるかを測るベンチマークです。論文では、人間との大きな性能差が報告されています。
続きを読むGAMUT は、長文回答が正しいだけでなく、必要な事実を十分に含んでいるかを評価するためのベンチマークです。二層のメタルーブリックにより、開放的な生成タスクの複雑な採点を機械評価へ落とし込みます。
続きを読むApple-PI は、動画がそれらしく見えるかではなく、物理法則に沿って生成されたかを問うベンチマークです。結果だけでなく、そこに至る推論過程まで評価します。
続きを読む新しい論文は、セキュリティAIエージェントを評価する際に、最高成功率だけでなくコストを同時に見る必要があると主張する。攻撃側タスクと防御側タスクでは、性能向上の仕方が大きく異なる。
続きを読むVIABench は、盲人・視覚障害者が記録または共有した一人称動画を用いて、マルチモーダル大規模言語モデルの実用的な支援能力を評価するベンチマークです。
続きを読むStripeは、AIエージェントが実際に近い環境でStripe連携を端から端まで構築できるかを測るベンチマークを公開した。結果からは、コード実装能力の向上と同時に、検証、状態管理、異常時の復旧に課題が残ることが見えてくる。
続きを読むOpenAIのCFOであるSarah Friar氏は、AIのROIを評価するための実務的なスコアカードを示した。焦点は派手なデモではなく、有用な仕事、成功タスクあたりのコスト、信頼性、計算資源のリターンにある。
続きを読むこの論文は、CTFや固定タスク中心の評価では、AIペンテストAgentの実運用能力を十分に測れないと指摘する。提案されているのは、検証済みの脆弱性発見を軸にした、より現実的な評価プロトコルだ。
続きを読むVentureBeat Pulse Research が 157 社を対象に行った調査では、企業が AI Agent により大きな自律性を与える一方で、それを制御する評価への信頼は低いことが示された。問題の本質は、評価結果が実際の顧客環境での結果と一致していない点にある。
続きを読むHugging Face Blog の記事は、より新しい汎用OCRモデルが常に優位とは限らないことを示している。ブラジル・ポルトガル語に特化した DharmaOCR は、専用ベンチマークで Mistral OCR4 と Unlimited-OCR を上回った。
続きを読むACM MM 2026 採択論文は、動画 LLM のベンチマーク精度が必ずしも視覚理解を意味しないと指摘する。著者は、元動画と黒画面入力での正答差を測る Visual Dependency Gap(VDG)を提案した。
続きを読む