从训练到搜索:AI 编程系统如何冲上 IOI 金牌线
导语
竞赛编程一直是检验语言模型复杂推理、算法设计和代码可靠性的高难度场景。与只需生成可运行代码的普通编程任务不同,IOI 等赛事要求模型理解题意、设计高效算法、处理边界情况,并在有限提交次数和时间内不断修正方案。题为《Post-Training Language Models for Gold-Medal Performance in Coding Competitions》的研究,试图回答一个问题:通用大模型经过系统化后训练,能否稳定达到国际竞赛金牌水平?
核心要点
- 完整的专项训练链路。 研究团队整理了 22,000 道竞赛编程题,并结合合成推理轨迹、监督微调(SFT)与强化学习(RL),构建面向竞赛的训练流程。
- 比较不同规模与训练方式。 Nemotron-3-Nano-CC 是 30B-A3B 模型,接受了 SFT 和 RL;Nemotron-3-Ultra-CC 是 550B-A55B 模型,采用 SFT。这样的设置可以观察模型规模与后训练方法各自带来的收益。
- 把测试时计算用于解题迭代。 研究提出 GenCorrect,让模型生成多个不同方案,再根据反馈进行评估、筛选和改写,而不是一次性输出答案。它的重点不只是“多想一会儿”,而是形成生成、检查、修正的循环。
- 分数随流程显著提升。 在 IOI 2025 评测中,Nano-CC 的成绩从基础状态的 130 分提升到后训练后的 291 分;加入 GenCorrect 后达到 468 分,超过 438.3 的金牌线。Ultra-CC 得到 502 分。
- 进一步面向赛事定制。 研究团队据此开发了专门的 Ultra-CC 系统,并在 IOI 2026 中进行前瞻性评测。按照与人类选手相同的时间、联网和提交限制,该系统获得 535.4/600 分,高于 361.12 的金牌线,也高于最高人类选手的 498.27 分。
意义与影响
这项工作的价值不只在于一个竞赛分数。它说明,编程模型的能力提升可能来自多环节协同:高质量题目决定训练覆盖,合成轨迹提供解题过程,SFT 负责建立专项能力,RL 则有机会强化正确性,而测试时搜索进一步弥补单次生成的不稳定。对算法题而言,验证器、测试数据和代码执行反馈也为模型提供了比自然语言任务更明确的纠错信号。
同时,结果不应简单理解为模型已经全面替代人类程序员。论文聚焦的是规则明确、可自动判分的竞赛环境;模型使用了专门的数据、训练和推理流程,且成绩依赖测试时生成与筛选。更重要的是,竞赛分数反映了特定问题集上的综合表现,并不等同于真实软件工程中的需求沟通、系统维护或长期可靠性。
这项研究释放出的清晰信号是:当模型训练从通用预训练延伸到任务数据、反馈机制和推理时预算的联合设计时,复杂编码任务的上限仍可能被明显推高。未来值得继续观察的是,这套方法能否迁移到未见过的题型、开放式工程任务以及更严格的成本约束中。
评论
正在确认登录状态……
正在加载评论……