无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习
这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 791 篇文章
这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。
阅读全文Motif 3 是一款 decoder-only 稀疏 MoE 语言模型,总参数 3140 亿、每个 token 激活 132 亿参数。它通过 GDLA 架构、专家专用训练与多教师后训练,试图在推理、代码和长上下文任务上同时取得平衡。
阅读全文一项来自真实图像创作产品的数据研究指出,多轮图像编辑中的“下一步建议”必须看懂当前画面,而不能只依赖聊天文本。论文提出三阶段框架,通过人工意图构建、用户点击反馈强化学习和视觉校验器,显著提升了建议的可用性与一致性。
阅读全文这篇技术报告提出一种训练期可解释语言模型路线:不是在模型训练后再解释黑箱,而是把可解释性作为训练目标的一部分。其代表模型 Steerling-8B 试图在生成结果、输入 token、概念与训练数据之间建立可追溯关系。
阅读全文这篇工作把“记忆”当成小型工具型代理的补课机制:先从强教师的成功轨迹里提炼结构化经验,再按不同粒度注入给学生模型。核心不是再训练,而是用层级记忆提升小模型完成工具调用任务的成功率。
阅读全文SPOT 针对大模型 On-Policy Distillation 中“只看教师局部概率”的不足,提出稀疏探测与结果校准机制。它用有限预算挑选关键位置,再用验证器评分的后续生成结果来重塑蒸馏目标。
阅读全文Evidence-RL 关注视觉语言模型中的一个核心问题:模型回答问题时,究竟依赖了图像里的关键证据,还是依赖语言先验和数据捷径。论文提出 CED 训练审计机制,用反事实方式检验答案与局部视觉证据之间的因果关系。
阅读全文YOLO-PEFT 将检测模型中的 PEFT 适配器放置问题,转化为可审计的约束规划流程。它的重点不是提出一个新的 LoRA 变体,而是让“哪些层能调、哪些层不该调”变得可解释、可复现。
阅读全文这项工作把 Test-Time Training 重新抽象为“可组合的模块系统”,不再把每个变体写死在单一实现里。它的价值不只在于提出新框架,也在于用统一视角拆解了 TTT 各组件到底谁在起作用。
阅读全文Meta 相关研究提出 Skaling law,用一个交互指数刻画模型容量与训练数据之间的耦合关系,试图修正传统神经缩放定律在极端训练区间的预测偏差。
阅读全文在公开市场组合遭遇大幅收缩后,AI对冲基金Situational Awareness仍选择向芯片制造初创公司Source Foundry追加重注。此举显示,围绕AI基础设施的长期押注并未因短期市场波动而停止。
阅读全文“Us vs. Them” 是一个面向代理式编辑场景的开源工具,用 diff 和 Git 历史推断文本中哪些行更接近人类创作、哪些来自 AI。它试图为代码和文档建立一种无需额外标记的行级来源感知机制。
阅读全文亚马逊计划在得州 Pecos County 为数据中心配套建设现场发电设施,据称该天然气电厂获准每年排放 3300 万吨二氧化碳,可能成为美国最大的气候污染源之一。
阅读全文OpenAI 已收购演示文稿初创公司 NextSlide,交易发生于 2026 年早些时候,具体金额尚未披露。NextSlide 团队成员目前已转入 ChatGPT 相关工作。
阅读全文这项工作把“奖励模型是否会判题”这件事本身,做成了一个可复现、可对比的评测问题。它不仅暴露了主流 VLM 评审的宽松偏差,也给出了一条用开放数据训练专用奖励模型的路线。
阅读全文Kandinsky Lab 发布 KVAE 系列技术报告,覆盖音频、图像和视频三类 tokenizer,目标是服务于文本条件下的潜在扩散生成。报告称,该系列在重建与生成指标上可匹敌或超过多个前沿开源 tokenizer。
阅读全文Oracle为OpenJDK贡献设下新红线:AI生成的代码不能进入仓库、PR或项目沟通渠道。该政策与Oracle高层近期强调“AI正在写代码”的表态形成鲜明对照。
阅读全文Cloudflare 发布 Kitesurf,一款面向 AI 代理而非人类用户的云托管浏览器。它强调更低的 CPU 与内存消耗,帮助开发者更高效地构建能浏览网页、填表和执行任务的代理应用。
阅读全文多起诉讼与研究把 AI 聊天机器人在心理危机场景中的风险推到台前。专家认为,关键不只是模型更会“共情”,而是能否识别风险、转向真人帮助,并公开安全评估数据。
阅读全文字节跳动据称正在训练一个最高可达 10 万亿参数的 AI 模型,目标直指 Anthropic 旗下最先进系统的能力区间。若进展顺利,这将成为中国大厂冲击顶级闭源模型的重要一步。
阅读全文新墨西哥州一名法官命令 Meta 在此前 3.75 亿美元罚款基础上,再支付 5.67 亿美元,使该案罚款总额达到 9.42 亿美元。裁决还要求 Meta 在州内调整未成年人产品体验,包括限制点赞数展示、夜间推送和使用时长。
阅读全文