没有标准答案,模型也能在测试时自我优化:TTPO如何利用共识与分歧
导语
大语言模型的推理能力,已经可以通过强化学习和在线自蒸馏等后训练方法继续提升。但这类方法通常需要标准答案或可验证标签,因此很难直接迁移到测试时训练(TTT)场景:模型面对一个新问题时,往往只有输入,没有可供比较的正确解。
《TTPO: Test-Time Policy Optimization》关注的正是这个缺口。论文提出的Test-Time Policy Optimization(TTPO)不依赖人工标签,而是让模型先对同一道题生成多条推理轨迹,再用多数投票形成一个伪标签,并据此构造训练信号。
核心要点
- 不把多数投票当成绝对真理。 直接用投票结果指导所有Token存在明显风险。一旦多数答案错了,教师信号就可能把整条推理带偏。
- 采用非对称目标。 与伪标签一致的轨迹通过在线策略自蒸馏(OPSD)获得学习;与伪标签不一致的轨迹则进入分组强化学习分支,受到针对性的惩罚。
- 利用“分歧”识别高风险轨迹。 论文的观察是,不认同多数结果的轨迹通常本身更可能出错,即使多数投票偶尔也会错误。因此,分歧轨迹仍可提供负向训练信号,而不必先证明伪标签一定正确。
- 训练信号细化到Token。 蒸馏会降低已经趋于收敛位置的权重,把重点放在仍未稳定的Token;强化学习分支则主要惩罚模型对错误答案表现出较高信心的部分。
- 形成随模型进步而收紧的自监督闭环。 当模型生成质量提高,多数投票通常更稳定,路由到两个分支的信号也会更有区分度。
结果与意义
根据论文摘要,TTPO在没有标签的条件下,在五个竞赛级数学基准上达到与有标签监督的OPSD相当的表现;在测试时训练实验中,Qwen3-1.7B的结果由38.0%提升至45.2%。论文还报告了在不进行思考过程的设置下,性能提升幅度为25.2%至36.4%,并观察到跨任务泛化能力。
TTPO的价值不只是把多数投票换成训练标签,而是重新定义了伪标签错误时哪些信息仍然可用。它没有简单地相信共识,也没有完全丢弃少数意见,而是将一致轨迹和分歧轨迹放进不同的优化机制,再通过Token级筛选控制噪声。这种思路为无标签测试时适应提供了一个更稳健的方向。
当然,多数投票仍是方法的基础,其可靠性会影响训练闭环;摘要并未提供更完整的成本、超参数或长期稳定性细节。因此,TTPO更适合被看作一种有前景的算法框架,而不是已经解决测试时训练全部问题的最终方案。
评论
正在确认登录状态……
正在加载评论……