<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>模型训练 on 知识铺的博客</title>
    <link>https://index.zshipu.com/edudaily/tags/%E6%A8%A1%E5%9E%8B%E8%AE%AD%E7%BB%83/</link>
    <description>Recent content in 模型训练 on 知识铺的博客</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <lastBuildDate>Sat, 05 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://index.zshipu.com/edudaily/tags/%E6%A8%A1%E5%9E%8B%E8%AE%AD%E7%BB%83/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>贪婪指标一路上升，pass@64却从0.83暴跌至0.19</title>
      <link>https://index.zshipu.com/edudaily/post/20260905/%E8%B4%AA%E5%A9%AA%E6%8C%87%E6%A0%87%E4%B8%80%E8%B7%AF%E4%B8%8A%E5%8D%87pass64%E5%8D%B4%E4%BB%8E0.83%E6%9A%B4%E8%B7%8C%E8%87%B30.19/</link>
      <pubDate>Sat, 05 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://index.zshipu.com/edudaily/post/20260905/%E8%B4%AA%E5%A9%AA%E6%8C%87%E6%A0%87%E4%B8%80%E8%B7%AF%E4%B8%8A%E5%8D%87pass64%E5%8D%B4%E4%BB%8E0.83%E6%9A%B4%E8%B7%8C%E8%87%B30.19/</guid>
      <description>贪婪准确率曲线持续上升，单样本正确概率增加三倍，这些数字让团队以为RLVR训练大获成功。然而对同一检查点进行64次采样后，pass@64从0.83暴跌到0.19。相同的模型权重，却因观察角度不同得出了完全相反的评价。 这个案例直接戳破了当前AI基准测试中最常见的误区：把局部优化当作</description>
    </item>
  </channel>
</rss>
