記事とガイド

モデル評価

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 78 件の記事

CCTest · Blog
評価結果は実際に何を証明できるのか
モデル評価
cctest.ai
モデル評価

評価結果は実際に何を証明できるのか

Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。

続きを読む
CCTest · Blog
UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証
モデル評価
cctest.ai
モデル評価

UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証

UrbanGroundは、香港全域の3D地理空間データからインタラクティブな都市サンドボックスを構築し、局所的な視覚理解が長距離ナビゲーションに結び付くかを検証する。現在のMLLMは近距離の認識には強い一方、探索が長くなると方向維持や修正に課題を残す。

続きを読む
CCTest · Blog
FIRM-Video:動画を採点する前に証拠を確認する評価手法
モデル評価
cctest.ai
モデル評価

FIRM-Video:動画を採点する前に証拠を確認する評価手法

FIRM-Videoは、動画生成の報酬モデルに「採点する前に確認する」チェックリスト型の評価手順を導入する。指示追従、世界の一貫性、知覚品質を個別に検証し、90K規模のデータセットとベンチマークを構築した。

続きを読む
CCTest · Blog
Video-IFBench、動画マルチモーダルモデルの指示追従を検証
モデル評価
cctest.ai
モデル評価

Video-IFBench、動画マルチモーダルモデルの指示追従を検証

Video-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。

続きを読む
CCTest · Blog
AnTrapが明らかにするAndroid GUIエージェントの実行時の脆弱性
モデル評価
cctest.ai
モデル評価

AnTrapが明らかにするAndroid GUIエージェントの実行時の脆弱性

AnTrapは、解決可能なAndroidタスクの実行途中に現実的な実行時異常を注入し、GUIエージェントの頑健性を評価する。調査では多くのモデルで性能が低下し、学習で修正できる罠と、深い推論限界に由来する失敗が分かれた。

続きを読む
CCTest · Blog
Google DeepMind、モデルと試験問題を隠す二重盲検AI評価を試験導入
モデル評価
cctest.ai
モデル評価

Google DeepMind、モデルと試験問題を隠す二重盲検AI評価を試験導入

Google DeepMindは外部機関とともに、モデルの重みと評価用プロンプトを相互に見せない「二重盲検」AI評価を試験導入する。機密コンピューティングでベンチマーク汚染のリスク低減を目指す。

続きを読む
CCTest · Blog
SWE Refactor Bench、コーディングエージェントはリポジトリ全体を移行できるか
モデル評価
cctest.ai
モデル評価

SWE Refactor Bench、コーディングエージェントはリポジトリ全体を移行できるか

新たなベンチマークは、局所的なバグ修正ではなく、リポジトリ全体の技術スタック移行能力を測定する。520回の実行で、移行・動作・追加検証をすべて通過したのは5.4%にとどまった。

続きを読む
CCTest · Blog
科学AIエージェントは研究を前進させるが、完遂はまだ難しい
モデル評価
cctest.ai
モデル評価

科学AIエージェントは研究を前進させるが、完遂はまだ難しい

FrontierChallengeは、もっともらしい回答ではなく、検証可能な科学ワークフローを最後まで納品できるかを評価する。結果は、部分的な進捗と完全な完了の間に大きな差があることを示した。

続きを読む
CCTest · Blog
ClawProBench:AIエージェントを実行過程から評価する
モデル評価
cctest.ai
モデル評価

ClawProBench:AIエージェントを実行過程から評価する

ClawProBenchは最終回答だけでなく、証拠の取得、ランタイムへのルーティング、安全境界、反復実行の安定性まで評価する。結果は、ネイティブなランタイム作業の難しさと、一度の成功では信頼性を測れないことを示した。

続きを読む
CCTest · Blog
一度の成功は信頼性ではない:Thinkingboxで業務エージェントを評価する
モデル評価
cctest.ai
モデル評価

一度の成功は信頼性ではない:Thinkingboxで業務エージェントを評価する

Thinkingboxは、妥当な返答やツール呼び出しだけでなく、業務ワークフロー終了時のバックエンド状態まで検証するサンドボックスです。ベンチマークは、偶然の成功と安定した実行能力の間に大きな差があることを示します。

続きを読む
CCTest · Blog
GameXpert-Bench:ゲーム生成から本格開発までを測る
モデル評価
cctest.ai
モデル評価

GameXpert-Bench:ゲーム生成から本格開発までを測る

GameXpert-Benchは、コーディングエージェントのゲーム開発能力を、生成・バグ修正・多段階最適化の全工程で評価する。エージェントは遊べる土台の構築には強い一方、能動的な不具合発見や実行時検証、回帰の防止には課題を残す。

続きを読む
CCTest · Blog
MobilePA-Bench、複雑な実タスクでモバイルエージェントを評価
モデル評価
cctest.ai
モデル評価

MobilePA-Bench、複雑な実タスクでモバイルエージェントを評価

MobilePA-Benchは、画面操作だけでなく、ツール呼び出し、長期計画、メモリ、スキル、サブエージェント協調を評価するインタラクティブなベンチマークです。権限制限や実行時エラーが加わると、最先端LLMの信頼性が大きく低下することを示します。

続きを読む
CCTest · Blog
LongRCA Bench、長期エージェントの失敗を「誰が」「いつ」起こしたかで診断
モデル評価
cctest.ai
モデル評価

LongRCA Bench、長期エージェントの失敗を「誰が」「いつ」起こしたかで診断

LongRCA Benchは、長期実行エージェントの失敗分析を、責任を負う役割の特定と、最も早い決定的な根本原因ステップの特定に分けて評価する。1,140件の実際の失敗軌跡を用い、訓練不要のRCTA手法も検証した。

続きを読む
CCTest · Blog
RAGのインデックス拡張で回答が変わる理由
モデル評価
cctest.ai
モデル評価

RAGのインデックス拡張で回答が変わる理由

モデルやプロンプト、検索設定を固定しても、検索インデックスを拡張すると同じ質問への回答が変わる可能性がある。新しい研究は、通常の生成揺らぎとインデックス更新による変化を分離する「スナップショット互換性監査」を提案した。

続きを読む
CCTest · Blog
ハイブリッド思考型MLLMは正解だけでなく応答品質も問われる
モデル評価
cctest.ai
モデル評価

ハイブリッド思考型MLLMは正解だけでなく応答品質も問われる

新しい研究は、ハイブリッド思考型マルチモーダルモデルにおいて、思考モードと非思考モードの応答行動に大きな差があると指摘した。PatternEvalとPatternRLにより、正答率だけでは捉えにくい失敗を評価・低減する。

続きを読む
CCTest · Blog
ASRモデルは本当に音声を聞いているのか、ベンチマーク最適化の盲点
モデル評価
cctest.ai
モデル評価

ASRモデルは本当に音声を聞いているのか、ベンチマーク最適化の盲点

Hume AIの研究は、自動音声認識モデルが公開ベンチマークの正解文を再現する傾向を測定する手法を示した。音声が矛盾、欠落、曖昧さを含む場合でも、正解文をそのまま出力する高スコアのオープンモデルが確認されたという。

続きを読む
CCTest · Blog
NARU、日本語の超長時間動画における物語と文化理解を評価
モデル評価
cctest.ai
モデル評価

NARU、日本語の超長時間動画における物語と文化理解を評価

NARUは、日本語の長時間動画を対象に、物語の展開を追跡する能力と、明示されない文化的意味を推論する能力を同時に測るベンチマークです。既存のマルチモーダルモデルには、遠く離れた出来事の統合と文化的文脈に基づく推論に課題が残されています。

続きを読む
CCTest · Blog
QuoteBenchが示す、コーディングエージェントの隠れた失敗
モデル評価
cctest.ai
モデル評価

QuoteBenchが示す、コーディングエージェントの隠れた失敗

コーディングエージェントの成否は、モデルがどんなコマンドを生成したかだけでなく、その出力が実行前にどうシリアライズ、ラップ、再解析されたかにも左右されます。QuoteBenchは、単一の一致スコアでは見えない実行経路の問題を測定しました。

続きを読む