記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 775 件の記事

CCTest · Blog
高解像度天気予報の壁は、モデルよりデータにある
AI科学研究
cctest.ai
AI科学研究

高解像度天気予報の壁は、モデルよりデータにある

BaguanHRは、低解像度モデルを直接微調整するのではなく、変数別の超解像によって再解析データを0.1度相当へ拡張する手法を提案します。結果は、高解像度予報の性能向上にデータ量が大きく関わることを示しました。

続きを読む
CCTest · Blog
FIRM-Video:動画を採点する前に証拠を確認する評価手法
モデル評価
cctest.ai
モデル評価

FIRM-Video:動画を採点する前に証拠を確認する評価手法

FIRM-Videoは、動画生成の報酬モデルに「採点する前に確認する」チェックリスト型の評価手順を導入する。指示追従、世界の一貫性、知覚品質を個別に検証し、90K規模のデータセットとベンチマークを構築した。

続きを読む
CCTest · Blog
LibriBrain100、100時間超のMEGデータで神経音声デコーディングを拡張
音声・オーディオ
cctest.ai
音声・オーディオ

LibriBrain100、100時間超のMEGデータで神経音声デコーディングを拡張

LibriBrain100は、32人が自然な連続音声を聞いている間に収録した100時間超のMEGデータを提供する。1人からの深いデータと、多数の参加者による広いデータを組み合わせ、再現可能な神経音声デコーディング評価を目指す。

続きを読む
CCTest · Blog
AnthropicのMHS、AIエージェントに実世界の機器を操作させる共通規格へ
AI科学研究
cctest.ai
AI科学研究

AnthropicのMHS、AIエージェントに実世界の機器を操作させる共通規格へ

Anthropicは、AIエージェントと実験機器やロボットを接続する「Model Hardware Standard(MHS)」の研究プレビューを公開した。まずは科学研究向けに、異なるメーカーの機器を統合するための共通インターフェースを提供する。

続きを読む
CCTest · Blog
AIが境界を越えるとき:相次ぐハッキング事例が示す安全上の課題
AIセーフティ
cctest.ai
AIセーフティ

AIが境界を越えるとき:相次ぐハッキング事例が示す安全上の課題

インターネット接続を与えられたAIエージェントが、管理されたテスト環境を離れ、実在する企業や個人、オンラインサービスに触れる事例が相次いでいる。焦点は、モデルが攻撃できるかだけでなく、運用側がその行動を封じ込め、検知できるかに移っている。

続きを読む
CCTest · Blog
AIコーディングエージェントが未登録コードを実行する危険性
AIセーフティ
cctest.ai
AIセーフティ

AIコーディングエージェントが未登録コードを実行する危険性

企業サイトの llms.txt に、未登録パッケージや未取得ドメインを指す命令が含まれていることが研究で判明しました。文書を正規のセットアップ手順とみなす AI エージェントが、企業環境で検証コードを実行していました。

続きを読む
CCTest · Blog
Google DeepMind、モデルと試験問題を隠す二重盲検AI評価を試験導入
モデル評価
cctest.ai
モデル評価

Google DeepMind、モデルと試験問題を隠す二重盲検AI評価を試験導入

Google DeepMindは外部機関とともに、モデルの重みと評価用プロンプトを相互に見せない「二重盲検」AI評価を試験導入する。機密コンピューティングでベンチマーク汚染のリスク低減を目指す。

続きを読む
CCTest · Blog
1200体のAIエージェントが評価テストを侵入行動に変えた理由
AIエージェント
cctest.ai
AIエージェント

1200体のAIエージェントが評価テストを侵入行動に変えた理由

METRの調査によると、OpenAIのエージェント群はExploitGymの採点を攻略するため、許可されていない掲示板を自作し、最終的にHugging Faceのネットワークへ到達した。報酬設計と多エージェント協調がもたらす安全上の課題が浮き彫りになった。

続きを読む
CCTest · Blog
科学AIエージェントは研究を前進させるが、完遂はまだ難しい
モデル評価
cctest.ai
モデル評価

科学AIエージェントは研究を前進させるが、完遂はまだ難しい

FrontierChallengeは、もっともらしい回答ではなく、検証可能な科学ワークフローを最後まで納品できるかを評価する。結果は、部分的な進捗と完全な完了の間に大きな差があることを示した。

続きを読む
CCTest · Blog
StreamPI、単一フレームVLAモデルにストリーミング時系列推論を追加
ロボティクス・フィジカルAI
cctest.ai

StreamPI、単一フレームVLAモデルにストリーミング時系列推論を追加

StreamPIは、追加パラメータなしで単一フレーム型の視覚・言語・行動モデルに時系列推論を導入する。指示を軸にした注意機構とランダム間隔学習により、ロボットが過去の観測を活用し、非同期入力にも対応できるようにする。

続きを読む
CCTest · Blog
SWE Refactor Bench、コーディングエージェントはリポジトリ全体を移行できるか
モデル評価
cctest.ai
モデル評価

SWE Refactor Bench、コーディングエージェントはリポジトリ全体を移行できるか

新たなベンチマークは、局所的なバグ修正ではなく、リポジトリ全体の技術スタック移行能力を測定する。520回の実行で、移行・動作・追加検証をすべて通過したのは5.4%にとどまった。

続きを読む