贪婪指标一路上升,pass@64却从0.83暴跌至0.19
贪婪准确率曲线持续上升,单样本正确概率增加三倍,这些数字让团队以为RLVR训练大获成功。然而对同一检查点进行64次采样后,pass@64从0.83暴跌到0.19。相同的模型权重,却因观察角度不同得出了完全相反的评价。
这个案例直接戳破了当前AI基准测试中最常见的误区:把局部优化当作整体进步。团队的仪表盘上所有贪婪指标都在变好,但真正反映模型生成多样性和覆盖率的pass@64却崩盘。这样的反差不是个例,而是当前强化学习与验证(RLVR)流程中普遍存在的评估盲区。
贪婪指标与pass@64测量的是模型的不同部分
贪婪采样每次只取模型概率最高的那个token,相当于让模型走最自信的那条路径。仪表盘显示的正确率曲线和单样本正确概率,正是这种确定性路径上的表现。信号中提到,训练期间这些数字稳步上升,正确-per-sample概率甚至翻了三倍,看起来是标准的成功曲线。
pass@64则完全不同。它要求对每个问题独立采样64次,只要其中任意一次输出正确就算通过。这个指标捕捉的是模型在温度采样下的输出多样性,以及是否能在多个尝试中覆盖正确答案。同一检查点,贪婪指标报喜,64次采样却显示pass@64从0.83掉到0.19,说明模型虽然在最优路径上更准了,但整体概率质量分布已经严重恶化。
两种指标看的是模型权重的不同切片。贪婪指标只关心最高概率token的链条是否正确,pass@64则在考察整个分布是否还能产生足够多的高质量变体。忽略这一点,就等于把“考试时只写标准答案”当成了“真正会解题”。
RLVR训练让模型输出分布快速退化
RLVR通过奖励机制强化正确路径,但这个过程同时在压缩模型的输出熵。信号显示,在训练前pass@64还能达到0.83,意味着模型有较好的探索能力,能在64次尝试中覆盖大部分正确解法。训练后同一权重下该数值跌至0.19,说明大部分采样路径都变成了低质量或重复的错误输出。
这种退化不是偶然。强化学习倾向于把概率质量集中到少数高奖励样本上,导致模型在贪婪解码时表现更好,却失去了生成多样正确答案的能力。仪表盘上的“进步”其实是用牺牲分布多样性换来的。团队看到的曲线攀升,本质上是模型在一条越来越窄的路径上越走越稳,却把其他可能正确的路径堵死了。
这个现象在代码生成、数学推理等需要多路径探索的任务上尤其致命。因为真实编程问题往往没有唯一标准答案,模型必须能生成多种合理实现方式。pass@64的崩盘表明,RLVR把模型变成了“只会一条路走到黑”的确定性机器。
预注册预测失败暴露了评估指标的盲区
团队事先预注册了自己的预测,认为这次RLVR运行会带来全面提升。结果证明这个预测完全错误。信号明确指出,预注册的判断基于当时的所有仪表盘数据,包括贪婪准确率和单样本概率的三倍增长,但完全没有预料到pass@64会发生如此剧烈的崩塌。
这种预注册失败的价值在于,它把指标盲区从事后总结变成了可验证的事实。团队原本以为只要贪婪指标持续向好,模型整体能力就会同步进步。实际结果却显示,两种指标可以在同一权重上给出完全相反的结论:一个说“教科书式的胜利”,另一个说“模型被毁了”。
这个反差提醒我们,当前主流评估体系中存在系统性漏洞。预注册本意是防止事后调整目标,却意外暴露了目标本身的问题。当最常用的指标与真正反映生成能力的指标严重脱钩时,任何基于前者的预测都不可靠。
单一指标驱动的迭代容易制造虚假进步
只盯着贪婪准确率迭代模型,相当于把所有资源都押在一条最窄的评价维度上。信号中的案例显示,同一模型在不同采样策略下得出了截然相反的结论,这直接证明了单一指标的误导性。仪表盘上看起来漂亮的曲线,可能只是把模型推向了过拟合确定性路径的深渊。
虚假进步的危害在于它消耗真实算力和时间。团队以为自己在稳步前进,实际上却在不断降低模型的泛化能力和探索空间。等到真正需要多样性输出的时候,比如产品中需要模型提供多个候选方案时,才会发现之前的“进步”其实是倒退。
更糟糕的是,这种误导会形成正反馈循环。看到贪婪指标变好,就继续加码同样的训练目标,结果让输出分布进一步退化。信号中pass@64从0.83到0.19的断崖式下跌,正是这种循环的直接后果。它说明只看单一指标的迭代不仅无法带来真正进步,还可能永久损害模型的核心能力。
中文开发者在模型落地时需警惕指标陷阱
对中国开发者而言,这个案例的警示意义更加现实。国内很多团队在做代码助手、数学教育工具或垂直领域大模型落地时,资源相对有限,一旦被虚假指标误导,浪费的不仅是算力,更是宝贵的迭代窗口。
假设一个团队正在基于某个开源模型开发编程助手,如果只看greedy accuracy和单样本通过率,很可能得出“模型越来越强”的结论,然后大规模部署。等到用户真实使用时发现模型虽然第一条建议很自信,但几乎没有提供其他可行方案,产品体验就会急剧下滑。信号中0.83到0.19的pass@64跌幅,意味着原本能覆盖大部分正确解法的模型,现在64次尝试里只有不到两成能命中,这对产品可靠性是致命打击。
在中文场景下,代码生成还涉及中英文混合注释、特定框架用法等额外复杂度,更需要模型保持足够的输出多样性。只依赖贪婪指标做决策,容易让团队在错误的方向上越走越远,最终导致投入的研发资源无法转化为实际商业价值。建议开发者在每次重大迭代后,都至少补充pass@k这类多样性指标的验证,避免把局部优化当作全局胜利。
目前仍不清楚模型在哪些能力上被永久削弱
信号留下的最大疑问是:pass@64的崩盘到底削弱了模型哪些深层能力,这些损害是否可逆。目前还不清楚模型的探索能力是否还能通过后续训练恢复,也不知道需要设计哪些额外实验才能把受损的部分精确识别出来。
从已有数据看,模型在贪婪路径上的能力确实提升了,但这可能是以牺牲其他合理路径为代价。究竟是某些中间层表征被破坏,还是采样时的温度控制完全失效,目前没有答案。团队需要进一步实验,比如在不同温度下对比采样分布、分析token概率熵的变化、甚至尝试针对性微调来恢复多样性。
这些未知点正是下一步研究的重点。只有搞清楚RLVR在提升确定性能力的同时具体破坏了什么,才能设计出既能保持准确率又不牺牲多样性的训练方法。否则类似指标脱节的问题还会反复出现,持续消耗开发资源。
整个事件表明,AI评估体系亟需从“看哪个指标好看”转向“看模型在真实使用场景下的全貌”。贪婪指标不是错,但把它当作唯一标准就是严重错误。pass@64的暴跌提醒每一位开发者:模型权重相同不等于能力相同,观察角度不同,结果可能天差地别。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/edudaily/post/20260905/%E8%B4%AA%E5%A9%AA%E6%8C%87%E6%A0%87%E4%B8%80%E8%B7%AF%E4%B8%8A%E5%8D%87pass64%E5%8D%B4%E4%BB%8E0.83%E6%9A%B4%E8%B7%8C%E8%87%B30.19/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com