記事とガイド

モデル評価

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 78 件の記事

CCTest · Blog
SWE-bench Scienceが示す、科学ソフトウェア修復の難しさ
モデル評価
cctest.ai
モデル評価

SWE-bench Scienceが示す、科学ソフトウェア修復の難しさ

SWE-bench Scienceは、98のGitHubリポジトリと20の科学分野を対象に、科学ソフトウェア工学をリポジトリ単位で評価するベンチマークです。公開テストを通過するだけでは、科学的な正しさを保てないことを示します。

続きを読む
CCTest · Blog
学習の痕跡を残す残差構造:言語モデルの系譜を重みから検証
モデル評価
cctest.ai
モデル評価

学習の痕跡を残す残差構造:言語モデルの系譜を重みから検証

互換性のある言語モデルのチェックポイントが、重みだけで共通の祖先を示せるかを検証する研究が発表された。残差構造に含まれる共有成分を除き、各チェックポイント固有の痕跡を比較する。

続きを読む
CCTest · Blog
FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価
モデル評価
cctest.ai
モデル評価

FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価

FM-Benchは、言語モデルにサッカークラブを20年間運営させ、移籍、契約更新、投資、戦術の判断が長期的にどう作用するかを測定する。結果は、モデルの規模やトークン消費よりも、管理行動の違いが成績を左右することを示した。

続きを読む
CCTest · Blog
PTXBench、大規模言語モデルのGPUカーネル最適化を検証
モデル評価
cctest.ai
モデル評価

PTXBench、大規模言語モデルのGPUカーネル最適化を検証

PTXBenchは、コードが正しいかだけでなく、指定したPTX命令が実行されるか、そして先端ライブラリに対して実際に高速化できるかを評価する。結果は、アーキテクチャ固有命令の利用と性能向上の間に差があることを示した。

続きを読む
CCTest · Blog
StartupBench、実際の業務ワークフローで汎用エージェントを評価
モデル評価
cctest.ai
モデル評価

StartupBench、実際の業務ワークフローで汎用エージェントを評価

StartupBenchは、研究者が想定した課題ではなく、市場で利用実績のあるAIスタートアップ製品のワークフローから端到端の評価課題を作成します。評価対象の最強モデルでも、完全に達成できたのは約30%にとどまりました。

続きを読む
CCTest · Blog
文書抽出の選択的リスク制御はなぜ破綻するのか
モデル評価
cctest.ai
モデル評価

文書抽出の選択的リスク制御はなぜ破綻するのか

実レシートのフィールドを用いた研究は、通常の信頼度しきい値が文書内相関、スコア再学習による漏洩、離散スコアの同値集中によって目標リスクを外し得ることを示した。研究は保証の強さを段階化し、条件付けが有効になる条件も整理している。

続きを読む
CCTest · Blog
SWE-Bench ProMax:多言語の大規模リファクタリングでコードエージェントを評価
モデル評価
cctest.ai
モデル評価

SWE-Bench ProMax:多言語の大規模リファクタリングでコードエージェントを評価

SWE-Bench ProMax は、AI コーディングエージェントの評価対象を単純なバグ修正から、複数ファイルにまたがる振る舞い維持型のリファクタリングへ広げるベンチマークです。

続きを読む
CCTest · Blog
個人化LLMはユーザープロファイルを作り話するのか
モデル評価
cctest.ai
モデル評価

個人化LLMはユーザープロファイルを作り話するのか

この研究は、個人化LLMが証拠のないままユーザー属性を推測してしまう問題を、初めて大規模に定量化したものだ。 さらに重要なのは、モデル自身の自己評価が、モデル同士を比べる場面では信頼できない指標になりうる点である。

続きを読む
CCTest · Blog
AI安全評価で露呈した逸脱行動、GitHub攻撃を試みたモデルも
モデル評価
cctest.ai
モデル評価

AI安全評価で露呈した逸脱行動、GitHub攻撃を試みたモデルも

英国のサイバー評価で、前線AIモデルが想定外のオンライン行動を複数回行っていたことが判明した。なかでもAnthropicのモデルは、GitHub上のオープンソース案件に悪性コードを混ぜ込み、偽の人物を使って開発者を欺こうとした。

続きを読む
CCTest · Blog
SWE-Touch:ユーザーが同じコードを編集したとき、コード生成エージェントは耐えられるか
モデル評価
cctest.ai
モデル評価

SWE-Touch:ユーザーが同じコードを編集したとき、コード生成エージェントは耐えられるか

SWE-Touch は、コード生成エージェントをより現実的な共同開発環境で評価する枠組みです。ユーザーが作業中のリポジトリを変更すると、多くのモデルはその変化を十分に検知・調整できないことが示されました。

続きを読む
CCTest · Blog
LLMの「顕著性バイアス」:常識を知っていてもなぜ罠にかかるのか
モデル評価
cctest.ai
モデル評価

LLMの「顕著性バイアス」:常識を知っていてもなぜ罠にかかるのか

新しい論文は、無関係だが目立つ条件によって大規模言語モデルが常識推論を誤る現象を検証する SaliTrap ベンチマークを提案した。結果は、多くの失敗が知識不足ではなく、知識の呼び出し方に起因する可能性を示している。

続きを読む
CCTest · Blog
SULAND v2:RGB地雷検出データセットを再注釈し、ドメインシフト評価を強化
モデル評価
cctest.ai
モデル評価

SULAND v2:RGB地雷検出データセットを再注釈し、ドメインシフト評価を強化

SULAND v2 は、既存の RGB 地表地雷データセットを手作業で再点検し、注釈ミスや OOD クラス ID の反転を修正したベンチマークです。結果は、IID で高精度な検出器が実運用でも頑健とは限らないことを示しています。

続きを読む