AlayaRenderer-Flash:把生成式世界渲染推进到可玩的 30 FPS
Alaya Lab 提出的 AlayaRenderer-Flash 将生成式世界渲染从 0.56 FPS 提升到 31.54 FPS,让由物理引擎驱动的交互式场景接近实时可玩。它不是用文本直接“想象”视频,而是在保留世界状态和动力学的前提下合成 RGB 画面。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 795 篇文章
Alaya Lab 提出的 AlayaRenderer-Flash 将生成式世界渲染从 0.56 FPS 提升到 31.54 FPS,让由物理引擎驱动的交互式场景接近实时可玩。它不是用文本直接“想象”视频,而是在保留世界状态和动力学的前提下合成 RGB 画面。
阅读全文这篇论文关注 MoE 训练中常被低估的显存大户:优化器状态。作者提出 SkewAdam,按骨干网络、专家和路由器的差异分层分配状态,在显著降内存的同时保持甚至提升验证困惑度表现。
阅读全文一篇新论文用因果可解释性方法研究文生图 Diffusion Transformer,发现文本模板 token 虽然在编码器输出处几乎不携带具体提示词信息,却会在生成过程中成为维持对象身份的关键语义寄存器。
阅读全文这篇论文提出,RLVR 提升大模型推理能力时,权重奇异值谱几乎没有被重写,真正承载新能力的是输入与输出奇异向量框架的变化。基于这一观察,作者构建了固定谱的 ISO 优化栈,覆盖离线模型合并与在线训练优化。
阅读全文AlayaWorld 试图把文本、图像或视频输入转化为可探索、可持续演化的虚拟环境。它围绕长时程一致性、交互控制和推理效率,提出了一套基于视频扩散 Transformer 的世界建模方案。
阅读全文ABot-World-0 试图把“可控制的视频生成”推进到可实时闭环交互的世界模型形态。它围绕数据、训练蒸馏和推理系统做了端到端设计,在单张 RTX 5090 上实现 720P 最高 16 FPS 流式生成。
阅读全文SciForma 面向科学方法图生成中的“结构保真”难题,将图表质量拆分为组件、箭头和文本三条轴线,并用多维偏好优化强化同时正确。它试图解决当前开源模型看起来像图、但逻辑关系和标注容易出错的问题。
阅读全文AutoIndex 提出了一种面向检索系统的新思路:不急着改检索器或重排器,而是学习一套可执行的文档表示程序,在索引前自动改造文档。论文在 CRUMB 基准上固定使用 BM25,仍在 8 个任务中取得了稳定提升。
阅读全文Mage-Flow 试图证明,图像生成模型的竞争力不只来自参数规模,也来自 tokenizer、主干网络与训练系统的协同设计。它以 4B 规模同时覆盖文生图和指令式图像编辑,并提供 Base、RL 对齐和 4 步 Turbo 版本。
阅读全文这篇论文尝试把传统的“裁判式”反馈,升级为更高带宽的“教练式”经验知识。它的目标不是只给一个分数,而是把评估中的细粒度判断转化为可迁移的学习信号。
阅读全文NexForge 试图解决 LLM Agent 训练数据难以规模化的问题:不再围绕固定工具或代码库造题,而是从高层能力需求出发,自动生成可执行任务与专家轨迹。
阅读全文这篇工作试图解决一个长期痛点:视频编辑数据难采、成本高、任务类型又不够丰富。FlowMimic提出一种不用掩码的生成与编辑框架,把图像编辑样本实时转成视频编辑样本,并让模型在图像与视频两种模态之间相互“模仿”。
阅读全文这篇工作把焦点放在多语种自动语音识别中最难的一块:长期被忽视的中亚语言。作者用大规模自监督预训练加上更精细的数据均衡策略,试图缓解“头部语言”对模型的挤压。
阅读全文SeerGuard 针对移动端 GUI 代理的安全痛点,提出了一套执行前防护框架。它通过指令筛查和动作风险评估,把危险操作拦在真实设备受损之前。
阅读全文这篇论文的重点不是再造一个更大的通用模型,而是给搜索型工具代理搭建一个“能验证对错”的训练场。研究者希望借助自蒸馏,把代理从自己的轨迹中持续改进。
阅读全文GEPO 是对 GRPO 的轻量改造,核心不是简单压高熵或保低熵,而是按 prompt 分组的熵状态,去做更细粒度的优势项塑形。它试图解决混合任务训练中,不同题型探索需求不一致、导致统一熵控制失灵的问题。
阅读全文长上下文并不总是越多越好,尤其在编码代理处理工具输出时,冗余信息会迅速吞噬窗口。SWE-Pruner Pro 的思路是把“保留还是丢弃”直接交回给模型内部表示来判断。
阅读全文DiFA 是一个无需重新训练的扩散模型推理框架,试图用前向扩散过程的统计结构来校准反向生成轨迹。它将历史预测视为相关观测,通过时间共识和偏差引导提升生成稳定性与细节保留。
阅读全文RynnBrain 1.1 试图把感知、空间推理、定位与规划放进同一套具身框架中,并进一步把输出对齐到机器人操作。它的重点不只是“看懂世界”,而是让模型更接近真实执行。
阅读全文API 调用型智能体要学会“做事”,离不开大量高质量轨迹,但真实环境往往难搭、难扩、难覆盖。新论文提出用 LLM 直接模拟状态化环境,在只有 API 规格的情况下合成训练数据。
阅读全文