评测集不是一堆问题,而是可管理的测试资产
E01暴露的三大评测缺陷 E01中研究者手工构造了10个问题用于测试大模型,很快发现这些问题存在明显缺陷。首先,它们完全是“随手想”的,没有任何系统化的分类或覆盖逻辑。这导致评测结果无法说明模型在不同能力维度上的真实表现,模型答对几个问题就很难推断其整体水平。 其次,这些问题严重脱离……
专注于Android、Java、Go语言(golang)、移动互联网、项目管理、软件架构