記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 791 件の記事

CCTest · Blog
StartupBench、実際の業務ワークフローで汎用エージェントを評価
モデル評価
cctest.ai
モデル評価

StartupBench、実際の業務ワークフローで汎用エージェントを評価

StartupBenchは、研究者が想定した課題ではなく、市場で利用実績のあるAIスタートアップ製品のワークフローから端到端の評価課題を作成します。評価対象の最強モデルでも、完全に達成できたのは約30%にとどまりました。

続きを読む
CCTest · Blog
PTXBench、大規模言語モデルのGPUカーネル最適化を検証
モデル評価
cctest.ai
モデル評価

PTXBench、大規模言語モデルのGPUカーネル最適化を検証

PTXBenchは、コードが正しいかだけでなく、指定したPTX命令が実行されるか、そして先端ライブラリに対して実際に高速化できるかを評価する。結果は、アーキテクチャ固有命令の利用と性能向上の間に差があることを示した。

続きを読む
CCTest · Blog
LEGO-RL、ネイティブなコーディングHarnessを強化学習に接続
コーディングAI
cctest.ai
コーディングAI

LEGO-RL、ネイティブなコーディングHarnessを強化学習に接続

LEGO-RLは、実際のコーディングエージェントが使うHarnessを大きく改変せず、方策勾配による強化学習へ接続する枠組みです。Qwen3.5-35B-A3Bを3種類のHarnessで学習し、SWE-bench Verifiedのスコアを向上させました。

続きを読む
CCTest · Blog
MathForm、検索と検証で数学の自動形式化を反復改善
AI科学研究
cctest.ai
AI科学研究

MathForm、検索と検証で数学の自動形式化を反復改善

MathForm は Mathlib の知識検索、コンパイラ診断、意味的一貫性フィードバックを組み合わせ、数学的記述を段階的に修正する。約 367K 件の検証済み Lean 4 例から学習した 8B モデルは、複数の専用 32B モデルを上回ったと報告されている。

続きを読む
CCTest · Blog
OpenAI、顧客データを保持しない安全監視でAnthropicに対抗
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、顧客データを保持しない安全監視でAnthropicに対抗

OpenAIは、一部顧客向けにPrivate Safety Processingのプレビューを開始した。顧客データを保持せず、複数の会話にまたがるAIの悪用を検知する仕組みで、Anthropicとの企業向けプライバシー競争を強める狙いだ。

続きを読む
CCTest · Blog
GoogleのSpirit従業員データ買収に客室乗務員が懸念する理由
政策・規制
cctest.ai
政策・規制

GoogleのSpirit従業員データ買収に客室乗務員が懸念する理由

GoogleはSpirit Airlinesの大規模な企業データを1,000万ドルで落札した。第三者による匿名化が予定されている一方、客室乗務員側は、氏名を削除しても雇用上の機密性や推測による再特定のリスクは残ると主張している。

続きを読む
CCTest · Blog
OpenAI、サイバー研究者のアクセスを誤って取り消し再認証を要求
AIセーフティ
cctest.ai
AIセーフティ

OpenAI、サイバー研究者のアクセスを誤って取り消し再認証を要求

複数のセキュリティ研究者が、OpenAIのTrusted Access for Cyberプログラムへのアクセスを突然失ったと報告しました。OpenAIは一部ユーザーに影響した技術的な問題だと説明し、再申請と本人確認を求めています。

続きを読む
CCTest · Blog
Meta広告にAI「脱衣」アプリ、女性政治家を狙う深刻な監視漏れ
AIセーフティ
cctest.ai
AIセーフティ

Meta広告にAI「脱衣」アプリ、女性政治家を狙う深刻な監視漏れ

Metaのプラットフォームで、同意のない性的ディープフェイクを促すようなAIサービス「Kromix」の広告が掲載されていた。広告の一つでは、米国の著名な女性政治家に酷似した顔がポルノ映像に使われていた。

続きを読む
CCTest · Blog
MOSS-VL、話しながら見続けるリアルタイムVLMを設計
マルチモーダル
cctest.ai
マルチモーダル

MOSS-VL、話しながら見続けるリアルタイムVLMを設計

MOSS-VLは、視覚言語モデルに「話している間も見続ける」能力を組み込むことを目指したオープンモデル群です。ゲート付きクロスアテンション、対話行動を学ぶデータ、段階的な訓練によって、ストリーミング環境への対応を設計段階から行っています。

続きを読む
CCTest · Blog
HarmProfile:フロンティアLLMの有害出力を「リスク分布」として捉える
AIセーフティ
cctest.ai
AIセーフティ

HarmProfile:フロンティアLLMの有害出力を「リスク分布」として捉える

HarmProfileは、有害生成を単なる脱獄攻撃の成功結果ではなく、分析すべき対象として扱う。調査は、フロンティアモデルごとに異なるリスク像があり、能力向上に伴って有害性と出力の多様性が高まる可能性を示した。

続きを読む
CCTest · Blog
データベースのACIDをAIエージェントへ:長期タスクを支える「エージェントトランザクション」
AIエージェント
cctest.ai
AIエージェント

データベースのACIDをAIエージェントへ:長期タスクを支える「エージェントトランザクション」

新たな研究は、推論やツール利用、コード生成、ワークスペース操作を行うLLMエージェントに、データベースのACID原則を応用する「エージェントトランザクション」を提案した。関連ベンチマークでは既存エージェントを10.6%上回ったと報告している。

続きを読む