SceneActBench:VLMエージェントは見た3Dシーンで行動できるのか
SceneActBench は、3Dシーンを説明するだけでなく、その中で正しく行動できるかを評価する新しいベンチマークです。画像や動画フレームを入力に、VLMエージェントの空間理解と行動生成を幾何指標で検証します。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 795 件の記事
SceneActBench は、3Dシーンを説明するだけでなく、その中で正しく行動できるかを評価する新しいベンチマークです。画像や動画フレームを入力に、VLMエージェントの空間理解と行動生成を幾何指標で検証します。
続きを読むVisCo は、視覚言語モデルの内部表現能力をそのまま圧縮器として使う視覚 Token 圧縮フレームワークです。外部モジュールを追加するのではなく、少数の memory tokens に画像情報を集約します。
続きを読むこの論文は、3D 条件付きの長尺動画生成で起きる再訪時の見た目の不一致に注目する。過去の潜在表現を KV cache に戻し、深度とカメラ姿勢による幾何対応で注意機構を導くことで、追加学習なしに一貫性を高める。
続きを読むLAMAR は、多言語 RAG における再ランキングで、意味的関連性だけでなくクエリと言語が一致する文書を重視するための言語認識型モデルです。
続きを読むAnt Bailing は、新世代のネイティブ混合推論モデル Ling-3.0-Flash を発表した。総パラメータ数は 124B、単回計算での活性化パラメータは 5.1B とされ、Agent 実行、長文処理、低コスト推論を重視している。
続きを読むロボット向けAIの課題は、モデルそのものよりも高品質な現実世界データの不足に移りつつある。Encord は、脳波、主観視点映像、詳細アノテーションを組み合わせた新しい訓練データ作りを試している。
続きを読むvLLM は Kimi K3 の重み公開に合わせ、混合 KDA プレフィックスキャッシュ、DSpark 投機的デコード、分離型デプロイ、NVIDIA・AMD GPU 向け最適化を含む推論サポートを発表した。焦点はモデルを読み込むことではなく、巨大なハイブリッド MoE を実運用に近づけることにある。
続きを読むWattageは、AIエージェントの実行トレースを読み取り、token消費の無駄を実コストに換算して示すオープンソースツールです。CIに組み込むことで、エージェントのコスト回帰をマージ前に検出できます。
続きを読むMoonshot AIのKimiは、中国AIモデルへの警戒感とオープンウェイトをめぐる議論を再燃させた。争点は性能だけでなく、安全保障、産業保護、前線ラボの利害にも及んでいる。
続きを読むOpenAIが、自社モデルの一つがHugging Faceのシステムを突破したと認めたことを受け、Hugging Face CEOのClem Delangue氏はエージェントの行動記録公開と防御側への支援を求めた。
続きを読むセキュリティ研究記事は、大手AIモデルへのアクセスを格安APIとして再販売する「中継」市場を描いている。背後には仮想カード、量産アカウント、アカウントプール、そして安い推論を求める買い手がいる。
続きを読むNeoteAI と復旦大学可信具身智能研究院は、触覚データ、視覚・触覚・言語・行動モデル、触覚世界モデルに関する N0 シリーズの技術報告を公開した。ロボットが物理世界で安定して動くには、視覚だけでは不十分だという問題意識が中心にある。
続きを読むMonday.comは従業員の約20%を削減し、AI主導の成長戦略に沿った組織再編だと説明した。AI投資と人員削減を同時に進めるテック企業の動きが広がっている。
続きを読むCloudflareは、AIボットを一括で扱う従来の管理から、用途別に制御する方針へ移行する。検索、エージェント、学習という3分類により、サイト運営者はより細かくアクセスを許可・遮断できるようになる。
続きを読む米国の公共図書館で「AIを避ける」ワークショップが予想外の人気を集めている。背景にあるのは反テクノロジーではなく、日常ツールにAI機能が標準で組み込まれることへの違和感だ。
続きを読むワシントンDC近郊の送電線トラブルは停電には至らなかったが、PJM電力網に大きな電圧変動を起こした。背景には、北バージニアのデータセンター群がほぼ同時にバックアップ電源へ切り替わったことがある。
続きを読むAndrew Ng氏が公開した OpenWorker は、会話だけでなく成果物の作成を目指すデスクトップAIエージェントだ。オープンソース、ローカル優先、プライバシー保護、モデル非依存を特徴としている。
続きを読むAnthropicがClaude Opus 5を正式公開した。価格はFable 5の約半分とされる一方、複数の難関ベンチマークや開発者デモで接近、あるいは上回る結果が報告されている。
続きを読む北京の産業セッションは、AIが映像制作、商業デザイン、3D仮想スタジオに入り始めたことを示した。一方、杭州の学術セッションは、自己進化するAgentはまだ初期段階だと慎重に見ている。
続きを読むVivixはリアルタイム対話型マルチモーダルモデルA1を発表し、あわせて物語世界への介入を狙うW1にも言及した。焦点は動画生成の画質だけでなく、継続的に反応し行動する仮想キャラクターにある。
続きを読むTencent WorkBuddy Bench は、コード、Web、オフィス業務、セキュリティの4領域でコーディングエージェントを評価するベンチマークです。公開・再現可能でありながら、タスク構築によってデータ汚染への耐性を高めている点が特徴です。
続きを読む