无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习
这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。
阅读全文这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。
阅读全文SPOT 针对大模型 On-Policy Distillation 中“只看教师局部概率”的不足,提出稀疏探测与结果校准机制。它用有限预算挑选关键位置,再用验证器评分的后续生成结果来重塑蒸馏目标。
阅读全文这篇技术报告提出一种训练期可解释语言模型路线:不是在模型训练后再解释黑箱,而是把可解释性作为训练目标的一部分。其代表模型 Steerling-8B 试图在生成结果、输入 token、概念与训练数据之间建立可追溯关系。
阅读全文Meta 相关研究提出 Skaling law,用一个交互指数刻画模型容量与训练数据之间的耦合关系,试图修正传统神经缩放定律在极端训练区间的预测偏差。
阅读全文字节跳动据称正在训练一个最高可达 10 万亿参数的 AI 模型,目标直指 Anthropic 旗下最先进系统的能力区间。若进展顺利,这将成为中国大厂冲击顶级闭源模型的重要一步。
阅读全文GradCuit 提出一种测试时潜变量优化方法,把可优化的连续状态插入 Transformer 中间层,让最终答案的反馈能直接回传到内部推理状态。实验显示,它在多个指令微调模型和推理基准上较 CoT 与同类方法取得更稳健的提升。
阅读全文微软研究等作者提出 Weak-to-Strong On-Policy Distillation,试图解决前沿模型缺少更强教师模型时的蒸馏难题。它用多个较弱模型在 logit 空间构造“代理教师”,让强学生模型从弱监督中继续提升。
阅读全文这篇论文提出 Multi-Head Attention Residuals(MHAR),试图解决 Transformer 残差流只能以单一方式读取深度历史的问题。它用按特征子空间拆分的多头 softmax 做层间路由,在几乎不增加参数和计算的情况下改善验证损失。
阅读全文这项工作提出了一种新的离策略后训练方法 TOPL,不是直接教模型“照着错误输出学”,而是让模型学会判断每个 token 是否正确。结果表明,它在摘要和翻译等忠实生成任务上,都展现出更强的跨数据集泛化能力。
阅读全文Hugging Face Daily Papers 收录的论文介绍了 Loopie,一个以循环计算提升 Transformer 表达能力的 MoE 模型系列。作者称,在相同预训练计算预算下,Loopie 超过了常规 Transformer 基线,并在后训练后展现出强推理能力。
阅读全文DeepLoop 关注一个容易被忽视的问题:当 Transformer 通过重复使用同一组模块来增加“展开深度”时,传统残差缩放规则不一定仍然适用。论文提出按参数被重复访问的方式重新设定缩放,从而提升循环式语言模型的训练稳定性与效果。
阅读全文GigaWorld-Policy-0.5 试图解决世界动作模型在推理阶段“太重”的问题:训练时利用未来视觉动态,部署时只解码动作。其混合训练、专家化 Transformer 与 AutoResearch 搜索流程,共同指向更高效的机器人策略学习。
阅读全文一篇 arXiv 论文提出 Deep Interaction,让用户在大模型原始回答中直接编辑错误推理步骤,再将修正后的思路提炼成提示,引导模型沿正确路径继续推理。
阅读全文这篇 arXiv 论文从“秩是否能穿越深层网络”的角度,重新解释 Transformer 前馈块中残差连接、归一化位置和宽度扩展的作用。作者认为,许多看似用于控制数值幅度的设计,本质上也在调节梯度路径中的秩塌缩风险。
阅读全文这篇 arXiv 论文提出 DeltaMerge-LowRes,尝试用“语言 delta + 任务 delta”的方式降低低资源语言任务适配成本。核心发现是,不同合并规则会显著影响模型保留语言能力、执行任务和校准置信度的方式。
阅读全文