返回文章列表
大语言模型

NCP-ArchPreview:让语言模型从预测下一个词走向预测下一个概念

阅读约 3 分钟

导语

主流语言模型通常以“下一个词元是什么”为核心训练目标。这个目标适合逐步生成文本,却不一定能直接约束模型形成跨多个词元的语义规划。NCP-ArchPreview技术报告提出了一条不同路径:在保留标准下一词预测的同时,让模型预测代表更大语义单元的“下一个概念”,尝试把部分推理和规划过程引入离散潜在空间。

核心设计

NCP-ArchPreview并非简单增加一个辅助分类头。其流程首先从模型隐藏状态中构建概念表示,再通过乘积量化形成离散概念词表。模型随后使用独立的Concept Module预测未来概念,并将这些预测反馈给词元层,帮助后续文本生成。下一词预测与下一概念预测采用端到端联合训练,因此模型仍然能够按照标准自回归方式输出文本。

这一设计的关键,在于把不同时间尺度的预测目标放在同一架构中:词元目标关注局部语言连续性,概念目标则覆盖多个词元,强调更高层级的语义结构。与完全依赖连续隐藏状态相比,离散概念空间还为潜在表示提供了更明确的组织形式。不过,概念如何划分、量化误差是否会限制表达能力,以及概念反馈是否会在生成中引入偏差,仍是值得继续验证的问题。

报告中的结果

  • 模型规模为8.9B参数,使用Dolma-3数据集中的5.73万亿词元进行训练。
  • 报告称,仅消耗总训练词元的51.3%时,NCP-ArchPreview便达到OLMo-3-7B的最终预训练损失。
  • 完成预训练后,其下游任务宏平均成绩比OLMo-3-7B高2.45个百分点,其中GSM8K提升5.99个百分点。
  • 对照实验显示,性能增益分别来自潜在空间架构和NCP目标,而不是单一改动。
  • 在参数规模对齐的8.9B基线比较中,模型使用约85%的标准计算量便接近基线训练损失。

这些数字说明,作者关注的不只是最终准确率,也包括训练效率和目标设计的作用。不过,当前素材主要提供摘要层面的结果,尚不能据此判断它在更广泛任务、不同数据配比或长上下文场景中的稳定性。

意义与影响

NCP-ArchPreview代表了语言模型从纯词元级建模向多层次潜在预测演进的一种尝试。若后续研究能够证明概念预测在不同规模、语料和任务上都能稳定带来收益,那么语言模型或许可以在生成表面文本之外,显式学习更紧凑的语义中间表示,并减少部分重复的词元级计算。

但这条路线也带来新的工程问题,包括概念词表的更新成本、Concept Module的额外开销、推理时概念反馈的可靠性,以及离散化表示对罕见知识和细粒度语言现象的影响。因而,这份报告更适合被视为潜在空间语言模型的一项大规模验证,而不是传统下一词预测已经被取代的结论。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
大模型为何会回答无解问题?研究发现关键不在“不会识别”
大语言模型
cctest.ai
大语言模型

大模型为何会回答无解问题?研究发现关键不在“不会识别”

一项针对1.7B至70B规模指令模型的研究发现,模型往往已经在内部识别出数学和代码问题的结构性不可解,却没有把这一信号路由为拒答行为。问题更像是“识别—行动”之间的错配,而非能力缺失。

阅读全文
CCTest · Blog
Qwen3.8-Next架构解读:把效率、能力与稳定性放进同一张设计表
大语言模型
cctest.ai
大语言模型

Qwen3.8-Next架构解读:把效率、能力与稳定性放进同一张设计表

Qwen团队公布Qwen3.8-Flash-Next的架构与消融研究:模型以1250亿参数、每token激活60亿参数为基础,通过混合状态空间与注意力、门控残差及主机侧n-gram表降低训练成本。论文更强调,损失、下游能力、推理开销和训练稳定性必须联合优化。

阅读全文
CCTest · Blog
无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习
大语言模型
cctest.ai
大语言模型

无需外部监督的在策略自蒸馏:让大模型从自己的共识中学习

这篇论文提出 U-OPSD:只利用模型自身多次生成结果的一致性来构造伪答案,并在分歧样本上进行自蒸馏。实验显示,该方法在数学推理基准上可稳定提升 Qwen3 等模型表现,并能匹敌或超过带真值监督的方法。

阅读全文