开发者趋势观察中转查编辑部5 分钟阅读
Nemotron-3 专项后训练冲击编程竞赛,模型评测转向完整解题流程
一项研究用 2.2 万道竞赛题进行监督微调与强化学习,并以 GenCorrect 迭代修正方案,在 IOI 2026 约束下报告 535.4 分。

核心判断编程模型评测转向生成、测试、修正的完整闭环
#22,000 题#GenCorrect#535.4/600
完整解题流程才可比中转查编辑部的判断
编程模型的竞争焦点从通用问答转向题目筛选、代码生成、测试反馈和多次修正组成的闭环,开发团队需要重新设计代码 Agent 的评估方式。
训练数据覆盖完整解题链路
这项工作没有把编程能力简化成补全几行代码,而是围绕竞赛题建立了从题目筛选到提交验证的训练流程。模型先学习理解约束和构造算法,再通过监督微调与强化学习处理代码正确性。这样的数据组织让评测更接近实际开发中反复编译、运行测试和修复错误的过程。
研究同时训练不同规模的 Nemotron-3 变体,用来比较参数规模和后训练策略的作用。结果显示,专项数据与反馈回路都可能影响最终得分,单纯扩大模型并不能解释全部提升。
GenCorrect 把测试时计算变成反馈循环
GenCorrect 会生成多个解法,利用评估结果挑选更有希望的方案,再继续修正。它的核心不是让模型一次输出更长的思考,而是把编译器、样例和评测反馈转成下一轮生成的约束。对于复杂题目,这种外部反馈往往比继续堆叠自然语言解释更直接。
这也带来成本问题。候选数量、运行时间和评估次数都会增加,在线代码 Agent 需要在质量、延迟和算力之间做动态取舍。没有可靠沙箱和超时控制时,更多测试时计算可能只会放大资源消耗。
竞赛成绩不能直接等同于通用编程能力
IOI 结果说明系统在一组明确规则、可自动判题的任务上具备强大能力,但企业代码还包含需求沟通、依赖升级、权限边界、可维护性和上线回滚。竞赛分数可以作为算法推理信号,不能替代真实仓库中的工程验收。
中转查认为,开发团队应把这种闭环思路迁移到自己的测试环境:为每个任务提供可重复的构建和测试反馈,记录修正次数与人工接管点,再用通过率和维护成本衡量 Agent 的实际价值。
