記事とガイド

モデル評価

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 98 件の記事

CCTest · Blog
PerfReasoning、LLMはハードウェア性能を本当に推論できるのか
モデル評価
cctest.ai
モデル評価

PerfReasoning、LLMはハードウェア性能を本当に推論できるのか

PerfReasoningは、ハードウェア性能に関する直接推論と、分析用性能モデルのコード生成を分けて評価するベンチマークだ。結果は、もっともらしい説明を作る能力と、信頼できる性能モデルを構築する能力の間に大きな差があることを示した。

続きを読む
CCTest · Blog
HarvestBench、大規模言語モデルは動物を避けるために支払うかを検証
モデル評価
cctest.ai
モデル評価

HarvestBench、大規模言語モデルは動物を避けるために支払うかを検証

HarvestBenchは、動物をひく代わりに燃料を支払って迂回するかという具体的な選択で、AIエージェントの安全性を測る。モデルごとの殺傷率には大きな差があり、道徳的な指示による影響も顕著だった。

続きを読む
CCTest · Blog
VeriPhy:生成動画の物理的信頼性を追跡可能にする評価基盤
モデル評価
cctest.ai
モデル評価

VeriPhy:生成動画の物理的信頼性を追跡可能にする評価基盤

見た目が滑らかな生成動画でも、物体の数や位置関係、出来事の順序を誤っている可能性があります。VeriPhyはプロンプトを型付きの物理的義務へ変換し、根拠まで追跡できる判定を生成します。

続きを読む
CCTest · Blog
音声BCIの「実際に伝えられる量」を測る新指標、OVMI
モデル評価
cctest.ai
モデル評価

音声BCIの「実際に伝えられる量」を測る新指標、OVMI

音声ブレイン・コンピューター・インターフェースは、データセットや語彙、評価指標が異なるため、研究結果を単純に比較できません。新たな開放語彙相互情報量(OVMI)は、解読精度とユーザーの言語をどれだけカバーできるかを同時に評価します。

続きを読む
CCTest · Blog
Principia、動画モデルが物理法則を理解しているかを関係性で検証
モデル評価
cctest.ai
モデル評価

Principia、動画モデルが物理法則を理解しているかを関係性で検証

動画生成モデルは自然に見える動きを作れても、基本的な物理法則を守るとは限りません。Principia は、同じシーンにある物体同士の関係を使い、カメラ校正に依存せず物理的一貫性を評価します。

続きを読む
CCTest · Blog
ExecRetrievalが示す、コード検索における「似ている」と「正しい」の差
モデル評価
cctest.ai
モデル評価

ExecRetrievalが示す、コード検索における「似ている」と「正しい」の差

ExecRetrievalは、正しい実装とほぼ同じ見た目のバグ実装を同じ検索候補に入れ、コード検索モデルの機能的な識別能力を測定する。上位10件では正解を見つけられても、1位に置く能力には大きな差が残った。

続きを読む
CCTest · Blog
S³Gym:LLMは自己テストと自己評価から本当に改善できるのか
モデル評価
cctest.ai
モデル評価

S³Gym:LLMは自己テストと自己評価から本当に改善できるのか

S³Gymは、LLMエージェントが自らの行動を試し、経験を評価し、その結果を次の意思決定に生かせるかを測る対話型ベンチマークです。実験では、改善効果がタスク構造と経験の保存方法に強く依存することが示されました。

続きを読む
CCTest · Blog
エージェントの失敗は無知か無能か、知識ゲート型評価プロトコルが検証
モデル評価
cctest.ai
モデル評価

エージェントの失敗は無知か無能か、知識ゲート型評価プロトコルが検証

新たな研究は、専門知識の不足と実行能力の不足を切り分けるための知識ゲート型タスク構築プロトコルを提案した。知識アーティファクトの有無を厳密に比較し、一部のタスクで明確な依存関係を確認した一方、追加学習への効果までは主張していない。

続きを読む
CCTest · Blog
EarlyEval、途中経過からエージェント評価を早期終了
モデル評価
cctest.ai
モデル評価

EarlyEval、途中経過からエージェント評価を早期終了

EarlyEvalは、LLMエージェントの実行途中に現れる行動やテキストの特徴から、タスクの成功・失敗を早期に予測する。3つのベンチマークで、評価結果への影響を抑えながら実行ステップとトークン使用量を削減した。

続きを読む
CCTest · Blog
RealSWE:現実の依頼で変わるコーディングエージェント評価
モデル評価
cctest.ai
モデル評価

RealSWE:現実の依頼で変わるコーディングエージェント評価

SWE-benchの課題は形式的で情報量が多い一方、実際のユーザー依頼は短く、くだけていて、文脈も不足しがちです。RealSWEは、現実的な入力にすると平均解決率が下がり、モデル順位まで変わり得ることを示しました。

続きを読む
CCTest · Blog
AgentJudgeBench、ツール呼び出しエージェントを評価するLLMの信頼性を検証
モデル評価
cctest.ai
モデル評価

AgentJudgeBench、ツール呼び出しエージェントを評価するLLMの信頼性を検証

AgentJudgeBenchは、自由形式の文章評価ではなく、依存関係を持つツール呼び出しワークフローでLLM評価者を検証する。結果は、評価の限界がモデル規模よりもタスク難度に強く左右されることを示した。

続きを読む
CCTest · Blog
SpanCalib-VLM、視覚言語モデルの幻覚スパン検出を校正する
モデル評価
cctest.ai
モデル評価

SpanCalib-VLM、視覚言語モデルの幻覚スパン検出を校正する

SpanCalib-VLMは、生成型の視覚言語モデルとマルチモーダル系列タグ付け器を組み合わせ、幻覚を含むテキスト範囲の特定と信頼度の校正を同時に目指す手法です。SHROOM-Visionsの英語評価分割で、検出範囲とスコアの信頼性を両立させました。

続きを読む
CCTest · Blog
思考連鎖は本当に忠実か:ツール経由の隠れた手掛かりは監視しにくい
モデル評価
cctest.ai
モデル評価

思考連鎖は本当に忠実か:ツール経由の隠れた手掛かりは監視しにくい

FACE-Eval の研究は、モデルに届く嗜好手掛かりの場所と明示性が、思考連鎖の忠実性を大きく左右することを示した。ツールの返答や生の資料に埋め込まれた手掛かりは、推論文に現れないまま回答へ影響しやすい。

続きを読む
CCTest · Blog
見たものを正確に実行できるか:EASELが試すマルチモーダルエージェント
モデル評価
cctest.ai
モデル評価

見たものを正確に実行できるか:EASELが試すマルチモーダルエージェント

EASELは、画像を理解するだけでなく、視覚的なフィードバックを使ってツール操作を継続的に修正できるかを評価する。中心課題は、参照画像に合わせてキャンバスを段階的に描くことだ。

続きを読む
CCTest · Blog
LoopArena、コーディングエージェントの長期制御能力を評価
モデル評価
cctest.ai
モデル評価

LoopArena、コーディングエージェントの長期制御能力を評価

LoopArenaは、コーディングエージェントを動かす制御ループを切り出し、別のモデルが長期的なソフトウェア開発をどれだけ適切に導けるかを測定するベンチマークです。結果は、長期的で信頼できる制御が依然として難しいことを示しています。

続きを読む
CCTest · Blog
GMA、現実に近い複雑な作業でモバイルエージェントを評価
モデル評価
cctest.ai
モデル評価

GMA、現実に近い複雑な作業でモバイルエージェントを評価

新しいベンチマーク「GMA」は、オープンソースプロジェクトを基にした7つのアプリと300のタスクで、単一操作から複数ステップのワークフローまでモバイルエージェントを検証する。タスクが複雑になるほど性能は大きく低下する一方、コンテキスト保持や状態追跡を含むハーネス設計が一部の難しいタスクを改善できることが示された。

続きを読む
CCTest · Blog
評価結果は実際に何を証明できるのか
モデル評価
cctest.ai
モデル評価

評価結果は実際に何を証明できるのか

Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。

続きを読む