Masked Diffusion LMはAgent強化学習向けの新しいテキスト世界モデルになるか
この論文は、Masked Diffusion Language Modelsをテキストベースの世界モデルとして用いることで、自回帰モデルの左から右への生成バイアスを緩和できると主張している。工具スキーマ、過去の対話、期待される結果などのグローバルな制約を保ちやすい点が焦点だ。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 795 件の記事
この論文は、Masked Diffusion Language Modelsをテキストベースの世界モデルとして用いることで、自回帰モデルの左から右への生成バイアスを緩和できると主張している。工具スキーマ、過去の対話、期待される結果などのグローバルな制約を保ちやすい点が焦点だ。
続きを読むDistilled Reinforcement Learning は、結果報酬に依存する強化学習と、教師分布を無条件に模倣するオンライン蒸留の間を狙う手法です。教師モデルの選好を token レベルの方策勾配に反映します。
続きを読む長い録音で「何が起きたか」だけでなく「いつ起きたか」まで答えることを目指した音声LLMです。最大120分の入力に対して、明示的なタイムスタンプ付きで応答できます。 周期的な時間マーカーを音声トークンと交互に入れ、合成データで学習させる設計が特徴です。
続きを読むHarmoHOI は、多視点 HOI 合成で難しい「見た目の一貫性」と「3D運動の整合」を同時に扱う。RGB動画と3D点軌跡を一つの拡散枠組みで共同生成するのが特徴だ。
続きを読む本論文は、オフポリシー生成をそのまま模倣するのではなく、各トークンが正しいかどうかを学習するTOPLを提案する。要約と翻訳の両方で、分布ずれに対する頑健性が示された。
続きを読むTimeLens2 は、動画の時間的グラウンディングを可変数の区間集合として扱い、モデルが出来事だけでなく根拠となる時間帯も示せるようにする研究です。2B、4B、8B の各モデルは Qwen3-VL バックボーンから大きな改善を示しています。
続きを読む3D-Fitは、構造ベース創薬において汎用LLMが三次元の空間制約を満たすリガンドを生成できるかを評価する新しいベンチマークです。結果は有望さを示す一方、専用拡散モデルとの差も明確にしています。
続きを読むEvolvingWorldは、単発の会話生成ではなく、物語の進行に合わせて人物と世界の状態が更新され続ける仕組みを提案する。静的な人物模倣から、長期的な整合性を重視する方向へ踏み出した研究だ。
続きを読むReflectWorld-MM は、連続する動画の中で誰が何度現れ、何が変わったのかを、実体単位で記憶することを狙った研究です。動画を切り出して保存する発想から、世界の出来事を整理して覚える発想へと移っています。
続きを読むHOMIEは、人の同一性を保ちながら、物体との関係や動作の整合性も高めることを狙う動画生成フレームワークです。多モーダル大規模モデルの知識を、生成過程へより自然に組み込みます。
続きを読むApple-PI は、動画がそれらしく見えるかではなく、物理法則に沿って生成されたかを問うベンチマークです。結果だけでなく、そこに至る推論過程まで評価します。
続きを読むDiffGI は、衣服のような薄い殻状・非多様体の 3D 形状を、従来の体積表現ではなく表面中心の 2D ジオメトリ画像として扱う手法です。連続 2D TSDF と可微分 Marching Squares により、2D 潜在空間と 3D 表面損失を直接つなげます。
続きを読むJoyNexusは、VLAモデルの教師あり微調整、強化学習、評価を共有インフラ上で扱うための多テナント型サービスフレームワークを提案している。
続きを読む207 件の GitHub プロジェクトと 102 万件のレビュー済み Pull Request を分析した研究は、AI Agent の参加がレビュー判断を速める一方で、品質改善には一貫した効果が見られないと報告している。
続きを読むこの論文は、RLVR におけるエントロピー中心の advantage shaping の限界を指摘し、Contrastive Policy Optimization(CPO)を提案している。参照誘導生成と通常生成の token レベルの分布差を使い、より正しさに近い学習信号を作る点が特徴だ。
続きを読むSVR-R1 は、推論時の自己チェックを強化学習の訓練ループに組み込む手法です。モデルは回答を出した後、自ら Yes/No で判定し、No の場合は再考します。
続きを読むRecGPT-V3 は、ユーザー記憶、Semantic IDs による商品 grounding、潜在トークンによる効率的推論を組み合わせた産業向け LLM 推薦システムです。淘宝の「Guess What You Like」フィードで、GMV +3.97% と serving リソース消費 52.4% 削減が報告されています。
続きを読むこの研究は、プラズマ診断モデルをクリーンな入力だけでなく、現実的なセンサー故障条件で評価する。特に破壊現象に近いタイミングの信号劣化が、系列モデルに大きな影響を与えることが示された。
続きを読むRESOURCE2SKILLは、動画チュートリアル、コードリポジトリ、記事、参考成果物から、ソフトウェアAgentが再利用できる実行可能スキルを抽出する枠組みです。
続きを読む