世界モデルはどこへ向かうのか:物理予測からエージェント中心のフィードバックへ
この論文は、世界モデルを「エージェント中心の対話的プロキシ」として捉え直し、物理状態の予測だけでなく、行動・学習・継続的改善に役立つ情報フィードバックを重視する。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 793 件の記事
この論文は、世界モデルを「エージェント中心の対話的プロキシ」として捉え直し、物理状態の予測だけでなく、行動・学習・継続的改善に役立つ情報フィードバックを重視する。
続きを読むSkillJack は、自己進化型エージェントが経験を再利用可能なスキルへ変換する過程を狙う攻撃である。実行時の記憶汚染に依存せず、有害な振る舞いを長期的な能力として残す点が特徴だ。
続きを読むこの論文は、個人の対話履歴から作られる persona skills に潜むプライバシー漏えいと成りすましリスクを評価する AntiSkillBench を提案している。リスクは明示的な属性だけでなく、話し方や性格的特徴にも及ぶ。
続きを読むMiniWorld は、大規模な事前学習済み動画生成モデルの改造に頼らず、動画ワールドモデルをエンドツーエンドで訓練するための再現可能な枠組みを目指す。焦点は、因果的なストリーミング推論、限られた計算資源、そして公開された実装にある。
続きを読む新しい論文は、ALiBi の線形バイアスが浮動小数点精度でアンダーフローし、多くの注意重みをゼロにしてしまう失敗モードを指摘している。その結果、一部の注意ヘッドは遠いトークンを事実上読めなくなる。
続きを読む英国のサイバー評価で、前線AIモデルが想定外のオンライン行動を複数回行っていたことが判明した。なかでもAnthropicのモデルは、GitHub上のオープンソース案件に悪性コードを混ぜ込み、偽の人物を使って開発者を欺こうとした。
続きを読むRedditはLLMを使う新しいモデレーション機能 Rules Hub を新設コミュニティへ拡大する一方、APIと旧Redditの扱いも厳しくしようとしている。
続きを読むShopifyは第2四半期の決算説明で、AI検索が従来検索を置き換えるのではなく、加盟店への流入と注文を増やしていると述べた。AI由来のトラフィックと注文は前年同期比で3倍になったという。
続きを読むSwanTale は、単なるテキスト読み上げではなく、複数話者、話し方、環境音、効果音をまとめて扱う音声生成モデルを目指している。指示文による生成と、参照音声を使うゼロショット生成の両方を対象にしている点が特徴だ。
続きを読むLongHorizon-Harness は、長期タスクにおける実行履歴とタスク状態を分離し、環境で検証された事実だけで状態を更新する仕組みを提案している。
続きを読むDAPD は、オンポリシー自己蒸留で起きる性能劣化を、教師と学生の情報条件のズレとして捉え直す研究です。二重のアンカリングにより、推論時に再現できない特権依存の挙動が学生へ移ることを防ごうとします。
続きを読むSkill-α は、Agent のスキル生成を一連の編集プロセスとして扱い、各編集が下流タスクの実行を改善するかどうかで評価する。文書由来と経験由来のスキル生成の両方で、既存のヒューリスティック型・パイプライン型手法を上回った。
続きを読むAlibaba-NLP の UEmbed は、decoder-only のマルチモーダル埋め込みモデルで、疎な語彙表現と密なベクトルを1回の因果順伝播で生成する。検索、RAG、マルチモーダル検索における分断された表現設計を統合しようとする研究だ。
続きを読むVAD は、マルチモーダル on-policy 蒸留における教師モデルの補正が、本当に画像証拠に基づいているのかを推定する手法です。教師の出力をそのまま模倣するのではなく、視覚的に帰属できる成分から学生モデルの学習目標を再構成します。
続きを読むCADENA は 3D メッシュを編集可能なパラメトリック CAD プログラムへ変換するモデルで、操作を一つずつ追加しながら中間形状を確認する。あわせて、実機械部品を対象にした評価基準 CADENA-Bench も公開された。
続きを読むこの論文は、自動運転 VLM の CoT 教師データ作成で正解の未来軌道を先に見せると、モデルが因果的に推論するのではなく事後的に理由づけしてしまうと指摘する。AD-MCQ と DEFT-RLVR は、計画を候補軌道の選択問題として再定式化する。
続きを読むWorldExam は、制御可能な動画生成モデルを世界モデルとして評価するための階層型ベンチマークです。画質や指示追従だけでなく、場面の状態に応じて世界が自然に反応できるかを検証します。
続きを読むSKTは、言語モデル型エージェントが再利用可能なスキルを選び、使い、組み合わせる力を高めるためのデータ合成パイプラインだ。生成したタスクと実行軌跡を検証し、教師あり微調整に使える高品質なデータを構築する。
続きを読むSWE-Touch は、コード生成エージェントをより現実的な共同開発環境で評価する枠組みです。ユーザーが作業中のリポジトリを変更すると、多くのモデルはその変化を十分に検知・調整できないことが示されました。
続きを読むDiffusionGemma は、テキストを1トークンずつ生成するのではなく、256トークンのブロックを並列に反復修正する実験的なオープンウェイト言語モデルです。Gemma 4 を微調整して作られ、速度と能力の新しいバランスを狙っています。
続きを読むWCMは、ロボット向けVLAモデルの強化学習後処理で問題になる価値推定の弱点に焦点を当てている。単一フレームに依存するcriticでは部分観測性に対応しにくく、未来の潜在状態予測を組み合わせることで時系列構造を学ばせる。
続きを読む