E01暴露的三大评测缺陷 E01中研究者手工构造了10个问题用于测试大模型,很快发现这些问题存在明显缺陷。首先,它们完全是“随手想”的,没有任何系统化的分类或覆盖逻辑。这导致评测结果无法说明模型在不同能力维度上的真实表现,模型答对几个问题就很难推断其整体水平。 其次,这些问题严重脱离……

阅读全文