LiveAnimate:把 14B 视频扩散模型推向实时长流式人像动画
LiveAnimate 试图解决一个长期矛盾:扩散式人像动画质量高,但生成太慢、记忆开销也会随时长膨胀。该工作把 14B 级视频 DiT 改造成可实时流式推理的系统,并兼顾长序列稳定性。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 548 篇文章
LiveAnimate 试图解决一个长期矛盾:扩散式人像动画质量高,但生成太慢、记忆开销也会随时长膨胀。该工作把 14B 级视频 DiT 改造成可实时流式推理的系统,并兼顾长序列稳定性。
阅读全文UniSwap 面向说话视频中的身份替换任务,尝试在一个音视频扩散 Transformer 内同时迁移人物外观与声音音色。它的重点不只是生成效果,而是让换脸、换声、口型、动作和时序在流式场景中保持一致。
阅读全文StateFlow 提出一种以“持久3D世界状态”为核心的生成式预演框架,用于电影、游戏、建筑和城市设计等场景。它不再把视频一次性生成完,而是先构建可编辑世界,再围绕状态演化和相机访问进行迭代。
阅读全文一篇新论文把“能否始终不跑题、不自相矛盾”变成了可自动评测的任务。NCP-Bench 显示,即便语言表现很强的模型,在长轮次互动里也很容易失守。
阅读全文UniMoMo 提出一种后训练压缩框架,把已训练的大型推荐 MoE 模型转换为更小的标准 MoE。它以专家在校准数据上的功能相似性和路由流量为依据,在尽量保持推荐效果的同时降低推理开销。
阅读全文VibeLifeBench 试图补上智能体评测中的一个空白:真实生活任务不是一次性问答,而是持续数周、环境不断变化、规则经常没有明说的长期协作。
阅读全文Ex-Omni-2D试图解决一个关键问题:现有能听会说的多模态对话模型,往往缺少“视觉存在感”。它把文本、个性化语音和参考条件下的视频生成整合到同一套对话流程中。
阅读全文Evidence-RL 关注视觉语言模型中的一个核心问题:模型回答问题时,究竟依赖了图像里的关键证据,还是依赖语言先验和数据捷径。论文提出 CED 训练审计机制,用反事实方式检验答案与局部视觉证据之间的因果关系。
阅读全文SPOT 针对大模型 On-Policy Distillation 中“只看教师局部概率”的不足,提出稀疏探测与结果校准机制。它用有限预算挑选关键位置,再用验证器评分的后续生成结果来重塑蒸馏目标。
阅读全文这篇工作把“记忆”当成小型工具型代理的补课机制:先从强教师的成功轨迹里提炼结构化经验,再按不同粒度注入给学生模型。核心不是再训练,而是用层级记忆提升小模型完成工具调用任务的成功率。
阅读全文这篇技术报告提出一种训练期可解释语言模型路线:不是在模型训练后再解释黑箱,而是把可解释性作为训练目标的一部分。其代表模型 Steerling-8B 试图在生成结果、输入 token、概念与训练数据之间建立可追溯关系。
阅读全文一项来自真实图像创作产品的数据研究指出,多轮图像编辑中的“下一步建议”必须看懂当前画面,而不能只依赖聊天文本。论文提出三阶段框架,通过人工意图构建、用户点击反馈强化学习和视觉校验器,显著提升了建议的可用性与一致性。
阅读全文Motif 3 是一款 decoder-only 稀疏 MoE 语言模型,总参数 3140 亿、每个 token 激活 132 亿参数。它通过 GDLA 架构、专家专用训练与多教师后训练,试图在推理、代码和长上下文任务上同时取得平衡。
阅读全文这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。
阅读全文Ouroboros 将智能体的工具、提示词、上下文组装和核心实现纳入可演化范围,并通过经过审查的提交把改进变成后续运行时的一部分。论文称其在 Terminal-Bench 2.1、OSWorld-Verified 和 CL-Bench 上刷新了多项结果。
阅读全文SWE-Bench ProMax 将评测焦点从单点修 Bug 推向跨文件、跨语言的代码重构,试图缓解现有编程智能体基准逐渐饱和与测试质量存疑的问题。
阅读全文YOLO-PEFT 将检测模型中的 PEFT 适配器放置问题,转化为可审计的约束规划流程。它的重点不是提出一个新的 LoRA 变体,而是让“哪些层能调、哪些层不该调”变得可解释、可复现。
阅读全文Meta 相关研究提出 Skaling law,用一个交互指数刻画模型容量与训练数据之间的耦合关系,试图修正传统神经缩放定律在极端训练区间的预测偏差。
阅读全文这项工作把 Test-Time Training 重新抽象为“可组合的模块系统”,不再把每个变体写死在单一实现里。它的价值不只在于提出新框架,也在于用统一视角拆解了 TTT 各组件到底谁在起作用。
阅读全文在公开市场组合遭遇大幅收缩后,AI对冲基金Situational Awareness仍选择向芯片制造初创公司Source Foundry追加重注。此举显示,围绕AI基础设施的长期押注并未因短期市场波动而停止。
阅读全文“Us vs. Them” 是一个面向代理式编辑场景的开源工具,用 diff 和 Git 历史推断文本中哪些行更接近人类创作、哪些来自 AI。它试图为代码和文档建立一种无需额外标记的行级来源感知机制。
阅读全文