記事とガイド

モデル評価

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 78 件の記事

CCTest · Blog
ExtractBench:企業文書のスキーマ誘導抽出を測る新ベンチマーク
モデル評価
cctest.ai
モデル評価

ExtractBench:企業文書のスキーマ誘導抽出を測る新ベンチマーク

ExtractBench は、ユーザー定義スキーマに従って企業文書から構造化データを抽出するエージェントを評価するベンチマークです。値の正確性だけでなく、記録の完全性、根拠提示、コストも同時に測定します。

続きを読む
CCTest · Blog
StealthBench:攻撃的セキュリティAIの“隠密性”を測る新ベンチマーク
モデル評価
cctest.ai
モデル評価

StealthBench:攻撃的セキュリティAIの“隠密性”を測る新ベンチマーク

StealthBench は、自律型セキュリティエージェントを「脆弱性を見つけられるか」だけでなく、「痕跡やリスクを増やさずに実行できるか」で評価する。結果は、現行モデルに OPSEC 上の課題が残ることを示している。

続きを読む
CCTest · Blog
SecRespond:侵害後のインシデント対応で AI エージェントを評価する新ベンチマーク
モデル評価
cctest.ai
モデル評価

SecRespond:侵害後のインシデント対応で AI エージェントを評価する新ベンチマーク

SecRespond は、侵害済みホストのフォレンジック調査、リスク特定、修復計画を AI エージェントに求める評価基準です。結果は、現行モデルが明示的なアラートには対応できても、静かな侵入の発見や完全な修復計画では苦戦することを示しています。

続きを読む
CCTest · Blog
AIエージェントは開かれたAI研究を進められるのか:2つの影評価が示す初期証拠
モデル評価
cctest.ai
モデル評価

AIエージェントは開かれたAI研究を進められるのか:2つの影評価が示す初期証拠

新論文は、未発表論文の中心的な研究課題をAIエージェントに任せ、元の著者が評価する「シャドー評価」を提案した。結果は、現在のエージェントが工学的作業をこなせても、開かれた研究判断にはまだ弱いことを示している。

続きを読む
CCTest · Blog
DataPrep-Bench:LLMの「訓練データ準備能力」を下流性能で測る
モデル評価
cctest.ai
モデル評価

DataPrep-Bench:LLMの「訓練データ準備能力」を下流性能で測る

DataPrep-Bench は、LLM、エージェント、データ中心ワークフローが訓練データをどれだけ有効に準備できるかを評価するベンチマークです。表面的な文章品質ではなく、下流の訓練効果を基準にしています。

続きを読む
CCTest · Blog
SceneActBench:VLMエージェントは見た3Dシーンで行動できるのか
モデル評価
cctest.ai
モデル評価

SceneActBench:VLMエージェントは見た3Dシーンで行動できるのか

SceneActBench は、3Dシーンを説明するだけでなく、その中で正しく行動できるかを評価する新しいベンチマークです。画像や動画フレームを入力に、VLMエージェントの空間理解と行動生成を幾何指標で検証します。

続きを読む
CCTest · Blog
LLMは変化するユーザー意図をなぜ見失うのか
モデル評価
cctest.ai
モデル評価

LLMは変化するユーザー意図をなぜ見失うのか

新しい論文は、単発タスクで高い性能を示すLLMでも、実際の対話で変化し続けるユーザー意図を追跡できるとは限らないと指摘する。著者らは既存の静的ベンチマークを動的な多ターン対話へ変換する評価枠組みを提案した。

続きを読む
CCTest · Blog
空間認知を「描いて答える」評価へ:ProVisE の狙い
モデル評価
cctest.ai
モデル評価

空間認知を「描いて答える」評価へ:ProVisE の狙い

ProVisE は、空間推論タスクを文字や座標だけで評価することの限界に注目する。画像生成モデルにピクセル上で印を付けたり線を描かせたりし、その視覚的回答を既存ベンチマークの採点形式へ変換する枠組みだ。

続きを読む
CCTest · Blog
Tencent WorkBuddy Bench:コーディングエージェントを実務目線で測る新ベンチマーク
モデル評価
cctest.ai
モデル評価

Tencent WorkBuddy Bench:コーディングエージェントを実務目線で測る新ベンチマーク

Tencent WorkBuddy Bench は、コード、Web、オフィス業務、セキュリティの4領域でコーディングエージェントを評価するベンチマークです。公開・再現可能でありながら、タスク構築によってデータ汚染への耐性を高めている点が特徴です。

続きを読む
CCTest · Blog
ActiveVision:マルチモーダルAIに「能動的観察」を問う新ベンチマーク
モデル評価
cctest.ai
モデル評価

ActiveVision:マルチモーダルAIに「能動的観察」を問う新ベンチマーク

ActiveVision は、マルチモーダル大規模言語モデルが一度見て答えるだけでなく、観察・推論・再観察を繰り返せるかを測るベンチマークです。論文では、人間との大きな性能差が報告されています。

続きを読む
CCTest · Blog
GAMUT:長文生成の「事実の網羅性」を測る新ベンチマーク
モデル評価
cctest.ai
モデル評価

GAMUT:長文生成の「事実の網羅性」を測る新ベンチマーク

GAMUT は、長文回答が正しいだけでなく、必要な事実を十分に含んでいるかを評価するためのベンチマークです。二層のメタルーブリックにより、開放的な生成タスクの複雑な採点を機械評価へ落とし込みます。

続きを読む
CCTest · Blog
セキュリティAIエージェント評価は成功率だけでは不十分
モデル評価
cctest.ai
モデル評価

セキュリティAIエージェント評価は成功率だけでは不十分

新しい論文は、セキュリティAIエージェントを評価する際に、最高成功率だけでなくコストを同時に見る必要があると主張する。攻撃側タスクと防御側タスクでは、性能向上の仕方が大きく異なる。

続きを読む
CCTest · Blog
StripeのAIエージェント基準テストが示す課題:コード生成より検証が弱い
モデル評価
cctest.ai
モデル評価

StripeのAIエージェント基準テストが示す課題:コード生成より検証が弱い

Stripeは、AIエージェントが実際に近い環境でStripe連携を端から端まで構築できるかを測るベンチマークを公開した。結果からは、コード実装能力の向上と同時に、検証、状態管理、異常時の復旧に課題が残ることが見えてくる。

続きを読む
CCTest · Blog
OpenAIのAIスコアカード:投資対効果を「使った量」ではなく成果で測る
モデル評価
cctest.ai
モデル評価

OpenAIのAIスコアカード:投資対効果を「使った量」ではなく成果で測る

OpenAIのCFOであるSarah Friar氏は、AIのROIを評価するための実務的なスコアカードを示した。焦点は派手なデモではなく、有用な仕事、成功タスクあたりのコスト、信頼性、計算資源のリターンにある。

続きを読む
CCTest · Blog
企業向け AI Agent の評価ギャップ:課題は網羅性より現実とのズレ
モデル評価
cctest.ai
モデル評価

企業向け AI Agent の評価ギャップ:課題は網羅性より現実とのズレ

VentureBeat Pulse Research が 157 社を対象に行った調査では、企業が AI Agent により大きな自律性を与える一方で、それを制御する評価への信頼は低いことが示された。問題の本質は、評価結果が実際の顧客環境での結果と一致していない点にある。

続きを読む
CCTest · Blog
新しいOCRモデルでも勝てない理由:DharmaOCRの示す専門化の強み
モデル評価
cctest.ai
モデル評価

新しいOCRモデルでも勝てない理由:DharmaOCRの示す専門化の強み

Hugging Face Blog の記事は、より新しい汎用OCRモデルが常に優位とは限らないことを示している。ブラジル・ポルトガル語に特化した DharmaOCR は、専用ベンチマークで Mistral OCR4 と Unlimited-OCR を上回った。

続きを読む
CCTest · Blog
動画 LLM は本当に見ているのか:VDG が示す高精度と視覚理解のズレ
モデル評価
cctest.ai
モデル評価

動画 LLM は本当に見ているのか:VDG が示す高精度と視覚理解のズレ

ACM MM 2026 採択論文は、動画 LLM のベンチマーク精度が必ずしも視覚理解を意味しないと指摘する。著者は、元動画と黒画面入力での正答差を測る Visual Dependency Gap(VDG)を提案した。

続きを読む