用扩散语言模型做文本世界模型:Agent 强化学习的新模拟器路线
这篇论文把文本世界模型重新定义为可控的状态转移问题,并提出用 Masked Diffusion Language Models 缓解自回归模型的左到右偏置。实验显示,MDLM 在一致性、扎根性和 rollout 多样性上优于更大参数量的自回归模型。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 795 篇文章
这篇论文把文本世界模型重新定义为可控的状态转移问题,并提出用 Masked Diffusion Language Models 缓解自回归模型的左到右偏置。实验显示,MDLM 在一致性、扎根性和 rollout 多样性上优于更大参数量的自回归模型。
阅读全文Open-AoE 试图解决具身学习里最现实的问题:数据怎么来、怎么整理、怎么直接用。它把手机采集、结构化标注和下游训练工具串成了一条开源流水线。
阅读全文这篇论文提出 Distilled Reinforcement Learning,将教师模型的细粒度偏好引入 LLM 后训练的策略梯度更新中,试图同时避开传统 RL 奖励稀疏和在线蒸馏盲目模仿的问题。
阅读全文这篇工作聚焦长录音中的时间定位问题,提出一种面向音频的时间感知 LLM,能够在最长 120 分钟的输入中给出带明确时间戳的回答,并支持片段描述与摘要生成。 它的核心思路,是把周期性的时间标记与连续音频 token 交错输入,再借助大规模合成监督训练。
阅读全文这项工作瞄准多视角 HOI 合成中最棘手的两个问题:画面要一致,手的三维运动也要对齐。HarmoHOI 通过联合扩散建模 RGB 视频与 3D 点轨迹,把外观和几何放进同一个生成过程里。
阅读全文这项工作提出了一种新的离策略后训练方法 TOPL,不是直接教模型“照着错误输出学”,而是让模型学会判断每个 token 是否正确。结果表明,它在摘要和翻译等忠实生成任务上,都展现出更强的跨数据集泛化能力。
阅读全文TimeLens2 将视频时序定位重新表述为“区间集合”问题,让模型不仅回答视频里发生了什么,还能给出支撑答案的时间片段。其 2B、4B、8B 版本在多项基准中相对 Qwen3-VL 骨干模型取得明显提升。
阅读全文Insilico Medicine 等作者提出 3D-Fit,用于评估通用大语言模型在结构化药物设计中处理三维空间约束的能力。结果显示,LLM 已能跟随多种局部空间指令,但距离物理可靠的分子生成仍有明显差距。
阅读全文这项工作把“文学世界模拟”从静态角色扮演推进到长程演化:角色会变化,场景会推进,世界状态也会被持续更新。它的重点不是单次生成,而是让多轮互动保持一致性与延续性。
阅读全文这项工作试图让 AI 不只是“看见”视频,而是把视频中的人、物、变化和事件真正记住。它的关键思路,是把记忆从按帧存储,转向围绕实体组织。
阅读全文HOMIE 面向人-对象中心的视频个性化,试图同时解决“像不像本人”和“互动对不对”这两类难题。它把多模态大模型知识更自然地接入视频生成流程,提升了对参考信息的理解能力。
阅读全文Apple-PI 试图回答一个更深的问题:视频模型生成得像不像只是表面,还是它真的按物理规律在“思考”。这项工作把物理定律引入视频模型评测,提供了更细的诊断视角。
阅读全文DiffGI 针对服装等薄壳、非流形 3D 形状难以被体表示准确建模的问题,提出以连续 2D TSDF 和可微 Marching Squares 连接 2D 潜空间与 3D 表面优化。它的重点不是单纯换一种编码,而是让表面重建从后处理变成可训练链路的一部分。
阅读全文JoyNexus 将 VLA 模型的微调、强化学习与评测封装为多租户服务,试图解决机器人后训练中资源独占、成本偏高与利用率不足的问题。
阅读全文一项基于 207 个 GitHub 项目、102 万个已评审 Pull Request 的研究显示,AI Agent 参与代码评审后,决策速度明显提升,但质量收益并不稳定。
阅读全文这篇论文提出 Contrastive Policy Optimization(CPO),尝试解决 RLVR 中把熵当作优势塑形信号时无法区分“有益不确定性”和“有害混乱”的问题。它通过比较参考引导生成与普通生成的 token 级分布差异,为训练提供更接近正确性的信号。
阅读全文SVR-R1 试图把推理时常见的自我检查,前移到强化学习训练循环中。它让视觉语言模型先回答、再给出 Yes/No 自判,并在否定时触发重新思考。
阅读全文RecGPT-V3 试图把大语言模型变成工业推荐系统中的“智能大脑”:既记住用户长期偏好,也能把自然语言意图更直接地映射到商品空间。其在淘宝首页“猜你喜欢”场景的 A/B 测试中带来 GMV +3.97% 和服务资源消耗下降 52.4%。
阅读全文一项基于 TokaMark 数据集的新评测把问题从“干净数据上谁更准”转向“传感器失效时谁还能工作”。结果显示,靠时间序列建模的 LSTM、Transformer 等模型在临近等离子体破裂的信号损坏下尤其脆弱。
阅读全文微软研究提出 RESOURCE2SKILL,尝试从教程视频、代码仓库、文章和参考作品中抽取可复用技能,让软件 Agent 不再只依赖手写提示或自身轨迹学习。
阅读全文