贪婪指标一路上升,pass@64却从0.83暴跌至0.19
贪婪准确率曲线持续上升,单样本正确概率增加三倍,这些数字让团队以为RLVR训练大获成功。然而对同一检查点进行64次采样后,pass@64从0.83暴跌到0.19。相同的模型权重,却因观察角度不同得出了完全相反的评价。 这个案例直接戳破了当前AI基准测试中最常见的误区:把局部优化当作……
专注于Android、Java、Go语言(golang)、移动互联网、项目管理、软件架构