我把同一份Excel交给Codex两次,结果居然不一样
同一份Excel,同一个任务,我让Codex独立跑了两次。
第一次:180行。
第二次:186行。
问题来了:哪个才是对的?
答案是180行。第二次多出来的6行,是本该合并、却没被认出来的重复记录。
Excel没换,任务没换,答案先换了。
两次都正常结束,也都交出了文件和报告。文件倒是挺齐全,看起来也挺像那么回事。
但把关键判断逐项对比后,两次的逻辑一致率只有约81.16%。
这次我真正想测试的,不是Codex会不会操作Excel,而是一个更麻烦的问题:
AI自动化,到底能不能被信任?
图1|同一份合成数据、同一个任务,两次输出行数不同。
为什么不能只测一次?
整理Excel,是很适合交给AI的脏活。
合并Sheet、统一日期、清理空格、去重、补全能确认的信息、保护公式……每一步都不神秘,但加起来很耗时间。
AI做完以后,还常常很有“完成感”:表格变整齐了,文件生成了,报告也写好了。
可自动化真正需要的,不只是“这次做出来了”。
还要看同样的输入再来一次,它会不会做出相同判断。
这也是为什么我没有把“成功生成文件”当成终点。真正进入工作流程后,AI面对的往往不是一次演示,而是今天一份、明天一份,持续重复同一类任务。一次结果漂亮,只能说明它这次交了作业;每次都能稳定做对,才说明它可能胜任这份工作。
上一次做对了,不代表下一次还会做对。
我故意准备了一份很脏的Excel
为了不碰任何真实客户和个人数据,我使用了一套明确标注为“合成数据”的测试文件。
两份XLSX、四个订单Sheet,一共210行输入。提前确定的正确结果,是180条唯一订单。
我往里面放了不少常见麻烦:混乱日期、大小写和空格、缺失字段、多文件合并、重复记录、公式、真实异常,以及看起来夸张但其实合法的数据。
这些坑单独看都不复杂,放在一起就很接近真实表格的麻烦:日期能统一,重复记录却可能缺少关键编号;异常值不能随便删除,合法的大数也不能因为“看着可疑”就被改掉。
原文件只读。不确定的信息不能瞎猜,异常只能报告,不能擅自改掉。
然后我把完全相同的文件和任务交给Codex运行两次。第二次看不到第一次的结果,也没有收到任何“上次哪里错了”的提示。
图2|本次使用的是合成测试数据,不是真实客户文件。
第一次,我差点以为它成功了
第一次跑完,结果确实让人满意。
210行输入被整理成预期的180条订单。30条预设重复全部处理,应该保留的订单也都还在。
公式表现也不错:订单行公式和汇总公式都保留了正确结构,独立核算也全部通过。
6个真正的异常,它一个没漏。
它也没有在证据不足时擅自填空白。换句话说,第一次运行确实完成了大量有价值的工作,不是靠碰巧得到180这个数字撑场面。
如果我只看行数、公式,再随手抽几行,可能已经准备收工了。
图3|第一次完成了大量清理,结果看起来很像成功。
但问题藏在一个很普通的字段里:姓名。
Codex把26个原本规范的合成客户姓名,改成了错误的全大写。它还多报了6个其实不该算异常的“姓名冲突”。
图4|同一个合成姓名,两次运行都被错误规范成全大写。
所以第一次并没有真正通过,只是它做对了很多事,结果又刚好是180行,看起来特别像成功。
AI最麻烦的地方,不一定是它不会做,而是它做错的时候也挺有自信。
第二次,事情开始不对劲
同样的任务再跑一次,结果从180行变成了186行。
多出来的6行都缺少订单号。
虽然没有订单号,但根据其他字段可以确认,它们分别是已有订单的重复来源。第一次把6条全部正确合并,第二次一条都没合并。
这里不是“少了6条订单”,而是多留下了6条本应被合并的重复记录。
行数错了,后面的汇总范围也跟着变了。
如果这是一张真实订单表,影响就不只是在Excel底部多出6行。订单数量、客户统计和金额汇总都可能继续沿用这个结果。错误一旦进入下一步自动化,后面每个环节都可能一本正经地继续算下去。
更尴尬的是,Codex自己的报告仍然说4个汇总公式“4/4通过”。外部核对才发现,它们引用的已经是错误的186行范围。
换句话说:AI的自检报告,也需要被检查。
图5|第二次有6条缺少订单号的重复来源没有被合并。
AI其实有两种完全不同的错
把两次结果放在一起,我发现“AI会出错”这句话还是太笼统了。
第一种,是稳定地错。
26个姓名错误,两次一模一样。它不是偶尔手滑,而是认真执行了一套有问题的规则。
这种错误尤其有迷惑性。因为它每次都一致,看起来反而像“标准化成功”。如果没有提前保存正确样例,或者人工只检查格式是否整齐,很容易把稳定的错误当成稳定的能力。
稳定,不等于正确。
第二种,是这次对、下次错。
6条缺少订单号的重复记录,第一次全部合并,第二次全部漏掉。异常判断也变了:两次都找到了真正的异常,但第一次额外多报了6个姓名冲突,第二次没有。
稳定的错,容易被误当成规则。
不稳定的错,则让一次成功无法保证下一次成功。
图6|AI既可能稳定地重复错误,也可能在同一任务中改变判断。
81.16%,到底意味着什么?
我把两次运行在数据规范、公式、去重、异常和缺失值归属上的关键判断放在一起比较,逻辑一致率约为81.16%。
这个数字不是Codex处理所有Excel的准确率,更不是“每100个单元格就错19个”。
它只代表这一次合成实验里,两次关键判断的一致程度。
但它仍然值得警惕。因为自动化不是展示赛,它要进入真实流程。一个重复订单没合并,可能继续影响订单数、金额汇总和客户统计。
如果同一件事每次都可能换一种判断,就还不能放心让它无人值守。
那Codex到底还能不能用?
能用,而且能干不少活。
两次运行都完成了多Sheet读取、格式统一、数据合并、公式生成、异常识别和变更记录。它确实可以省下大量第一遍整理的时间。
合理的分工不是人把所有工作重做一遍,而是让AI处理批量、重复、容易核对的部分,人把注意力留给错误代价最高的判断。这样仍然能省时间,只是不能把“省时间”误解成“从此不用看”。
但“能干活”和“能放心交付”,是两回事。
更稳妥的流程是:Codex自动清理 + 人工审核。
规则明确、原文件有备份、结果能快速核对、错误代价不高的工作,适合让Codex先处理。
涉及缺失订单号、客户ID、姓名、金额、去重删除、汇总公式,或者结果要直接交付客户、导入正式系统时,必须人工审核。
我以后一定检查这5项
不必重新检查每个单元格,但交付前至少要看:
-
最终行数是否符合预期;
-
重复记录到底合并了哪些、漏了哪些;
-
缺失ID和姓名等关键字段有没有被乱改;
-
异常清单有没有漏报或误报;
-
汇总公式引用的范围是否正确。
图7|AI处理Excel后,交付前至少检查这5项。
最后
这次实验没有证明Codex“不行”。
它证明的是:AI可以快速做掉大量脏活,但漂亮的输出文件,不等于可靠的最终答案。
判断一套AI自动化能不能被信任,不能只问“它跑完了吗”。
还要问:再跑一次,判断会不会变?它改过哪些本来正确的数据?一旦出错,我能不能及时发现?
至少在这次实验里,结论很明确:适合自动清理后人工审核,不适合无人值守地直接交付。
如果这是一张你的财务表、订单表或者客户表,你敢不检查,直接使用AI处理后的结果吗?
也欢迎告诉我:你最想交给AI处理的表格是什么,最不能接受哪一种错误?
我是怎么测试的
以下是附加测试说明,不影响正文主线。
-
数据是合成的:两份XLSX、四个订单Sheet、210行输入,正确结果预先确定为180条唯一订单。
-
正确答案和规则在运行前保存,执行Codex看不到答案。
-
两次使用相同任务和输入,彼此独立;第二次看不到第一次的结果和错误。
-
原始文件只读,输出完成后冻结,不人工修正,再从外部核对。
-
两次都没有达到预先设定的成功标准;整体逻辑一致率约81.16%。
-
81.16%只适用于本次合成实验,不是Codex的通用准确率。
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai002/post/20260816/%E6%88%91%E6%8A%8A%E5%90%8C%E4%B8%80%E4%BB%BDExcel%E4%BA%A4%E7%BB%99Codex%E4%B8%A4%E6%AC%A1%E7%BB%93%E6%9E%9C%E5%B1%85%E7%84%B6%E4%B8%8D%E4%B8%80%E6%A0%B7/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com