記事とガイド

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 791 件の記事

CCTest · Blog
退役GPUはどこまで使えるか?DumpsterClusterがLLaMA-70Bを推論
推論・デプロイ
cctest.ai
推論・デプロイ

退役GPUはどこまで使えるか?DumpsterClusterがLLaMA-70Bを推論

DumpsterClusterの研究は、退役したGPUを組み合わせても大規模言語モデルの推論基盤を構築できることを示した。一方で、低い導入費用だけでは十分ではなく、電気料金と電力の炭素強度が採算性と環境性能を左右する。

続きを読む
CCTest · Blog
UI-Mate、デモを参照して再計画するオープンウェイトGUIエージェント
AIエージェント
cctest.ai
AIエージェント

UI-Mate、デモを参照して再計画するオープンウェイトGUIエージェント

UI-Mateは、環境に根差した学習基盤と、コンテキスト内の操作デモから学ぶ仕組みを組み合わせたGUIエージェントです。UI-Mate-27BはOSWorld-Verifiedで77.0%を記録したと、提供された論文概要で報告されています。

続きを読む
CCTest · Blog
物理認知から自己参照認知へ:エージェントAIの認知リスクを考える
AIセーフティ
cctest.ai
AIセーフティ

物理認知から自己参照認知へ:エージェントAIの認知リスクを考える

上海人工知能研究所の論文は、LLMを基盤とするエージェントの認知範囲が広がることで生じるリスクを、物理認知、社会認知、自己参照認知の三段階に整理する。焦点は、能力向上の先で人間の主体性、自律性、制御能力をどう守るかにある。

続きを読む
CCTest · Blog
WorldRover、探索可能な世界モデル向けの豊富な合成動画を生成
世界モデル
cctest.ai
世界モデル

WorldRover、探索可能な世界モデル向けの豊富な合成動画を生成

WorldRover は、Unreal Engine を基盤に、長時間の探索経路と幾何・動き・対応関係の注釈を同時に生成するデータエンジンです。環境を維持・再訪できる世界モデルの学習を支えることを狙います。

続きを読む
CCTest · Blog
文書抽出の選択的リスク制御はなぜ破綻するのか
モデル評価
cctest.ai
モデル評価

文書抽出の選択的リスク制御はなぜ破綻するのか

実レシートのフィールドを用いた研究は、通常の信頼度しきい値が文書内相関、スコア再学習による漏洩、離散スコアの同値集中によって目標リスクを外し得ることを示した。研究は保証の強さを段階化し、条件付けが有効になる条件も整理している。

続きを読む
CCTest · Blog
SPARGen:3D再構成・密な対応付け・空間推論を統合するマルチモーダル生成モデル
マルチモーダル
cctest.ai
マルチモーダル

SPARGen:3D再構成・密な対応付け・空間推論を統合するマルチモーダル生成モデル

SPARGen は、空間理解に関わる複数のタスクを、指示条件付きの生成問題として統一する枠組みだ。個別モジュールではなく、同一のネイティブなマルチモーダル生成モデルで空間表現を学習する点に特徴がある。

続きを読む
CCTest · Blog
ChatGPTのComputer History、PC操作をAIの文脈に変える新機能
メモリ・コンテキスト
cctest.ai

ChatGPTのComputer History、PC操作をAIの文脈に変える新機能

OpenAIはmacOS版ChatGPTデスクトップアプリに、クリックや入力などの操作履歴をAIが参照できるComputer Historyを追加する。スクリーンショットは保存しないとされるが、個人の作業履歴をAIに渡すことへの慎重な検討は欠かせない。

続きを読む
CCTest · Blog
AIクレジット転売市場の台頭:Token Broker が生む新たなリスク
推論・デプロイ
cctest.ai
推論・デプロイ

AIクレジット転売市場の台頭:Token Broker が生む新たなリスク

セキュリティ研究記事は、スタートアップが使い切れない AI API クレジットを買い取り、割引価格で再販売する「token broker」の存在を追跡している。推論リソースが疑似通貨のように流通し始め、コスト削減の裏で安全性とコンプライアンスの課題が浮上している。

続きを読む
CCTest · Blog
UniSwap:顔と声の置き換えを一つのストリーミングモデルへ
マルチモーダル
cctest.ai
マルチモーダル

UniSwap:顔と声の置き換えを一つのストリーミングモデルへ

UniSwap は、話者動画における外見と声質の同時置き換えを目指す音声・映像統合フレームワークです。別々のモデルを後段でつなぐのではなく、単一の音声映像拡散 Transformer 内で両方を扱います。

続きを読む
CCTest · Blog
LiveAnimate:長尺の人物アニメーションをリアルタイム配信へ
推論・デプロイ
cctest.ai
推論・デプロイ

LiveAnimate:長尺の人物アニメーションをリアルタイム配信へ

LiveAnimate は、姿勢駆動の人物アニメーションにおける「高品質だが遅い」という課題に正面から取り組む研究です。14B パラメータの動画 DiT を、長時間でも安定して動くストリーミング推論システムへと再設計しています。

続きを読む
CCTest · Blog
StateFlow:生成型プリビズを編集可能な3D世界状態へ
世界モデル
cctest.ai
世界モデル

StateFlow:生成型プリビズを編集可能な3D世界状態へ

StateFlow は、映画、ゲーム、建築、都市設計向けの生成型プリビジュアライゼーションを、永続的な3D世界状態として扱う枠組みです。動画を一度に生成するのではなく、構築・進化・アクセス可能な編集用ワールドを中心に据えます。

続きを読む
CCTest · Blog
UniMoMo:推薦 MoE を専門家マージで軽量化する手法
推論・デプロイ
cctest.ai
推論・デプロイ

UniMoMo:推薦 MoE を専門家マージで軽量化する手法

UniMoMo は、学習済みの推薦向け MoE モデルを、より少ない専門家数の標準 MoE へ変換する後処理圧縮フレームワークです。重みの近さではなく、校正データ上での振る舞いとルーティング量を見て専門家を統合します。

続きを読む
CCTest · Blog
SWE-Bench ProMax:多言語の大規模リファクタリングでコードエージェントを評価
モデル評価
cctest.ai
モデル評価

SWE-Bench ProMax:多言語の大規模リファクタリングでコードエージェントを評価

SWE-Bench ProMax は、AI コーディングエージェントの評価対象を単純なバグ修正から、複数ファイルにまたがる振る舞い維持型のリファクタリングへ広げるベンチマークです。

続きを読む
CCTest · Blog
Ouroboros:レビュー済みコミットで自ら進化するコーディングエージェント
AIエージェント
cctest.ai
AIエージェント

Ouroboros:レビュー済みコミットで自ら進化するコーディングエージェント

Ouroboros は、ツール、プロンプト、コンテキスト構築、コア実装までを改善対象にする自己発展型のエージェント基盤だ。論文は複数のベンチマークで高い結果を報告しつつ、自己改変システムにおける安全設計の重要性を強調している。

続きを読む