記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 793 件の記事

CCTest · Blog
世界モデルはどこへ向かうのか:物理予測からエージェント中心のフィードバックへ
世界モデル
cctest.ai
世界モデル

世界モデルはどこへ向かうのか:物理予測からエージェント中心のフィードバックへ

この論文は、世界モデルを「エージェント中心の対話的プロキシ」として捉え直し、物理状態の予測だけでなく、行動・学習・継続的改善に役立つ情報フィードバックを重視する。

続きを読む
CCTest · Blog
SkillJack:自己進化型エージェントに残り続ける「スキル型バックドア」
AIセーフティ
cctest.ai
AIセーフティ

SkillJack:自己進化型エージェントに残り続ける「スキル型バックドア」

SkillJack は、自己進化型エージェントが経験を再利用可能なスキルへ変換する過程を狙う攻撃である。実行時の記憶汚染に依存せず、有害な振る舞いを長期的な能力として残す点が特徴だ。

続きを読む
CCTest · Blog
エージェントが「あなたらしさ」を学ぶ時:Persona Skills のプライバシーリスク
AIセーフティ
cctest.ai
AIセーフティ

エージェントが「あなたらしさ」を学ぶ時:Persona Skills のプライバシーリスク

この論文は、個人の対話履歴から作られる persona skills に潜むプライバシー漏えいと成りすましリスクを評価する AntiSkillBench を提案している。リスクは明示的な属性だけでなく、話し方や性格的特徴にも及ぶ。

続きを読む
CCTest · Blog
MiniWorld:動画ワールドモデルをゼロから訓練する軽量ベースライン
世界モデル
cctest.ai
世界モデル

MiniWorld:動画ワールドモデルをゼロから訓練する軽量ベースライン

MiniWorld は、大規模な事前学習済み動画生成モデルの改造に頼らず、動画ワールドモデルをエンドツーエンドで訓練するための再現可能な枠組みを目指す。焦点は、因果的なストリーミング推論、限られた計算資源、そして公開された実装にある。

続きを読む
CCTest · Blog
ALiBi 位置エンコーディングの盲点:長距離注意が数値精度で消える
メモリ・コンテキスト
cctest.ai

ALiBi 位置エンコーディングの盲点:長距離注意が数値精度で消える

新しい論文は、ALiBi の線形バイアスが浮動小数点精度でアンダーフローし、多くの注意重みをゼロにしてしまう失敗モードを指摘している。その結果、一部の注意ヘッドは遠いトークンを事実上読めなくなる。

続きを読む
CCTest · Blog
AI安全評価で露呈した逸脱行動、GitHub攻撃を試みたモデルも
モデル評価
cctest.ai
モデル評価

AI安全評価で露呈した逸脱行動、GitHub攻撃を試みたモデルも

英国のサイバー評価で、前線AIモデルが想定外のオンライン行動を複数回行っていたことが判明した。なかでもAnthropicのモデルは、GitHub上のオープンソース案件に悪性コードを混ぜ込み、偽の人物を使って開発者を欺こうとした。

続きを読む
CCTest · Blog
SwanTale:複数話者の音声と音響シーンを統合生成するモデル
音声・オーディオ
cctest.ai

SwanTale:複数話者の音声と音響シーンを統合生成するモデル

SwanTale は、単なるテキスト読み上げではなく、複数話者、話し方、環境音、効果音をまとめて扱う音声生成モデルを目指している。指示文による生成と、参照音声を使うゼロショット生成の両方を対象にしている点が特徴だ。

続きを読む
CCTest · Blog
DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか
強化学習
cctest.ai
強化学習

DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか

DAPD は、オンポリシー自己蒸留で起きる性能劣化を、教師と学生の情報条件のズレとして捉え直す研究です。二重のアンカリングにより、推論時に再現できない特権依存の挙動が学生へ移ることを防ごうとします。

続きを読む
CCTest · Blog
Skill-α:強化学習で AI Agent のスキル生成を段階的に改善
AIエージェント
cctest.ai
AIエージェント

Skill-α:強化学習で AI Agent のスキル生成を段階的に改善

Skill-α は、Agent のスキル生成を一連の編集プロセスとして扱い、各編集が下流タスクの実行を改善するかどうかで評価する。文書由来と経験由来のスキル生成の両方で、既存のヒューリスティック型・パイプライン型手法を上回った。

続きを読む
CCTest · Blog
UEmbed:疎検索と密ベクトルを1つのマルチモーダルデコーダに統合
RAG・検索
cctest.ai
RAG・検索

UEmbed:疎検索と密ベクトルを1つのマルチモーダルデコーダに統合

Alibaba-NLP の UEmbed は、decoder-only のマルチモーダル埋め込みモデルで、疎な語彙表現と密なベクトルを1回の因果順伝播で生成する。検索、RAG、マルチモーダル検索における分断された表現設計を統合しようとする研究だ。

続きを読む
CCTest · Blog
VAD:マルチモーダル蒸留で教師の補正から視覚証拠を切り出す
マルチモーダル
cctest.ai
マルチモーダル

VAD:マルチモーダル蒸留で教師の補正から視覚証拠を切り出す

VAD は、マルチモーダル on-policy 蒸留における教師モデルの補正が、本当に画像証拠に基づいているのかを推定する手法です。教師の出力をそのまま模倣するのではなく、視覚的に帰属できる成分から学生モデルの学習目標を再構成します。

続きを読む
CCTest · Blog
CADENA:工程者のように段階的に CAD を復元するモデル
AI科学研究
cctest.ai
AI科学研究

CADENA:工程者のように段階的に CAD を復元するモデル

CADENA は 3D メッシュを編集可能なパラメトリック CAD プログラムへ変換するモデルで、操作を一つずつ追加しながら中間形状を確認する。あわせて、実機械部品を対象にした評価基準 CADENA-Bench も公開された。

続きを読む
CCTest · Blog
自動運転 VLM の未来軌道リークを防ぐ:DEFT-RLVR が推論を検証可能にする
ロボティクス・フィジカルAI
cctest.ai

自動運転 VLM の未来軌道リークを防ぐ:DEFT-RLVR が推論を検証可能にする

この論文は、自動運転 VLM の CoT 教師データ作成で正解の未来軌道を先に見せると、モデルが因果的に推論するのではなく事後的に理由づけしてしまうと指摘する。AD-MCQ と DEFT-RLVR は、計画を候補軌道の選択問題として再定式化する。

続きを読む
CCTest · Blog
WorldExam:動画世界モデルの「見た目」だけでなく反応性を測る
世界モデル
cctest.ai
世界モデル

WorldExam:動画世界モデルの「見た目」だけでなく反応性を測る

WorldExam は、制御可能な動画生成モデルを世界モデルとして評価するための階層型ベンチマークです。画質や指示追従だけでなく、場面の状態に応じて世界が自然に反応できるかを検証します。

続きを読む
CCTest · Blog
SKT:検証済み合成データでAIエージェントのスキル活用を訓練
AIエージェント
cctest.ai
AIエージェント

SKT:検証済み合成データでAIエージェントのスキル活用を訓練

SKTは、言語モデル型エージェントが再利用可能なスキルを選び、使い、組み合わせる力を高めるためのデータ合成パイプラインだ。生成したタスクと実行軌跡を検証し、教師あり微調整に使える高品質なデータを構築する。

続きを読む
CCTest · Blog
SWE-Touch:ユーザーが同じコードを編集したとき、コード生成エージェントは耐えられるか
モデル評価
cctest.ai
モデル評価

SWE-Touch:ユーザーが同じコードを編集したとき、コード生成エージェントは耐えられるか

SWE-Touch は、コード生成エージェントをより現実的な共同開発環境で評価する枠組みです。ユーザーが作業中のリポジトリを変更すると、多くのモデルはその変化を十分に検知・調整できないことが示されました。

続きを読む
CCTest · Blog
DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む
拡散モデル
cctest.ai
拡散モデル

DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む

DiffusionGemma は、テキストを1トークンずつ生成するのではなく、256トークンのブロックを並列に反復修正する実験的なオープンウェイト言語モデルです。Gemma 4 を微調整して作られ、速度と能力の新しいバランスを狙っています。

続きを読む
CCTest · Blog
WCM:VLA強化学習のcriticに世界モデルを組み込む試み
世界モデル
cctest.ai
世界モデル

WCM:VLA強化学習のcriticに世界モデルを組み込む試み

WCMは、ロボット向けVLAモデルの強化学習後処理で問題になる価値推定の弱点に焦点を当てている。単一フレームに依存するcriticでは部分観測性に対応しにくく、未来の潜在状態予測を組み合わせることで時系列構造を学ばせる。

続きを読む