GPT-6 Astra ARC-AGI-3 得分从 7.8% 跳到 62.7%,是否已是最高智能模型

GPT-6 Astra 在 ARC-AGI-3 官方 Harness 下得分从 GPT-5.6 Sol 的 7.8% 直接跃升至 62.7%,OpenAI 定制 harness 后更是达到 99.9%。这一数字让 Greg 公开表示 ARC-AGI-3 已进入饱和状态。与此同时,OpenAI 选择如发布策略,先由水军和自媒体主导舆论,再开放实际使用。

这一跳跃式进步把前代模型远远甩在身后。上一代 GPT-5.6 Sol 在官方测试环境下仅拿到 7.8% 的分数,而 GPT-6 Astra 直接冲到 62.7%。更夸张的是,当 OpenAI 自己适配的 Harness 允许保留历史消息和推理上下文时,Astra 的得分达到 99.9%。这样的结果直接让 Greg 得出结论:ARC-AGI-3 已经饱和。

饱和意味着当前测试框架已经难以继续区分模型能力高低。过去几年里,ARC-AGI 系列被视为衡量通用智能的重要标尺之一,因为它考察模型在抽象推理、新颖任务上的表现,而不是单纯记忆训练数据。现在 Astra 把分数推到接近满分,测试本身的价值开始受到质疑。

与此同时,OpenAI 没有立刻把模型开放给所有人使用。他们先让营销和舆论先行,由自媒体和水军占据早期话语权。真实用户暂时无法给出反馈,这种“如发布”做法把好评窗口提前锁定,差评则被推迟到热度下降之后。

ARC-AGI-3 得分从 7.8% 跃至 62.7% 的具体数据

GPT-6 Astra ARC-AGI-3 得分从 7.8% 跳到 62.7%,是否已是最高智能模型:ARC-AGI-3 得分从 7.8% 跃至 62.7% 的具体数据

GPT-5.6 Sol 在官方 Harness 下仅取得 7.8% 的成绩,这一数据反映出前代模型在抽象推理任务上的明显短板。官方 Harness 严格限制上下文保留,模拟真实世界中模型面对全新问题时的处境。GPT-6 Astra 在完全相同设定下把分数提升到 62.7%,增幅超过八倍。

当切换到 OpenAI 定制的 Harness 后,情况进一步变化。定制版本允许模型保留历史消息和完整的推理上下文,此时 Astra 的得分直接攀升至 99.9%。两种 Harness 的差异说明上下文管理对模型表现影响极大。官方版本更接近零样本或少样本场景,定制版本则更像给模型提供了作弊空间。

62.7% 到 99.9% 的差距不是小修小补,而是测试条件彻底改变后的结果。Greg 据此判断 ARC-AGI-3 已进入饱和状态,意思是继续在这个基准上刷分已经没有太大意义。模型在该测试上已经接近天花板,未来需要新的、更难的评估框架。

这些数字目前仅来自公开的 Zhihu 回答,没有看到 OpenAI 官方完整技术报告。真实测试细节,比如具体题目数量、评分标准是否公开透明,仍有待进一步确认。但仅从已知数据看,Astra 在这一特定基准上的进步确实显著。

OpenAI 如发布策略如何先控场再放出模型

GPT-6 Astra ARC-AGI-3 得分从 7.8% 跳到 62.7%,是否已是最高智能模型:OpenAI 如发布策略如何先控场再放出模型

OpenAI 这次明显吸取了以往经验,选择不立刻开放模型给公众使用。他们先声称拥有 GPT-6 Astra,却把实际访问权限控制在极小范围内。这种“如发布”做法让水军和自媒体先把正面评价铺满网络。

自媒体在模型还未开放时就已经开始撰写测评、预测和解读。这些内容大多基于官方释放的少量数据或营销材料,天然倾向于正面。真实用户因为拿不到模型,无法发出基于实际体验的差评。舆论场在早期被单方面主导。

等到正面口碑基本确立,OpenAI 再逐步放开使用权限。此时即使出现真实用户差评,热度已经过去,讨论焦点也转向其他话题。整个过程把好评窗口最大化,把差评窗口尽量压缩。

这种策略在之前的 mythos 和 fable 项目中已经被验证有效。OpenAI 这次复制了相同路径,先控场再放出。结果是早期关于“最高智能模型”的讨论几乎一边倒,真实使用体验的反馈被推迟。

基准饱和后仍需其他任务验证智能上限

GPT-6 Astra ARC-AGI-3 得分从 7.8% 跳到 62.7%,是否已是最高智能模型:基准饱和后仍需其他任务验证智能上限

ARC-AGI-3 接近饱和并不等于模型整体智能已经到达顶点。Greg 的评价针对的是这个特定基准,而不是对 GPT-6 Astra 做出全面结论。单一基准饱和常见于快速迭代的 AI 领域,过去 GPT 系列也多次让旧基准失效。

ARC-AGI 系列强调抽象推理和对新任务的泛化能力。但智能还包括长期规划、多模态理解、工具使用、代码生成、复杂对话管理等多个维度。目前公开信息只集中在这一个基准上,没有看到 Astra 在其他权威测试如 GPQA、SWE-bench、HumanEval 或者实时世界任务中的完整数据。

即使在 ARC-AGI-3 上拿到 99.9%,也无法直接推断它在所有场景都领先。上下文保留带来的分数提升说明模型可能特别擅长利用记忆,而非纯粹的即时推理。真实世界中很多任务不允许无限上下文,这部分能力是否真正领先仍有待观察。

目前还不清楚 Astra 与 o1、Claude 3.5 Sonnet 在相同非官方 Harness 下的直接对比结果。没有这些交叉验证,单纯一个基准的饱和不能作为“最高智能”的最终证据。

真实用户差评窗口被如发布策略压缩

GPT-6 Astra ARC-AGI-3 得分从 7.8% 跳到 62.7%,是否已是最高智能模型:真实用户差评窗口被如发布策略压缩

真实用户无法在模型发布初期接触到产品,就失去了在舆论高峰期发出声音的机会。水军和自媒体主导的正面评价先占据搜索结果和社交媒体,普通开发者看到的几乎全是好评。

等到模型真正开放,早期热度已经消退。用户反馈即使出现,也很难再掀起大规模讨论。差评被推迟到话题已转向下一个模型的时候,其影响力被大幅削弱。

这种策略让 OpenAI 可以用最小的风险建立“最智能模型”的市场认知。用户在无法验证的情况下,倾向于接受已经形成的舆论。等到真正用上模型,发现某些实际任务表现不如预期时,已经为时已晚,切换成本也更高。

中文社区里同样存在这种情况。很多讨论基于二手信息转发,真正跑过模型的开发者声音在早期几乎不存在。等到能实际使用时,主流叙事已经固定。

多 benchmark 被干废是否等同于最高智能

GPT-6 Astra ARC-AGI-3 得分从 7.8% 跳到 62.7%,是否已是最高智能模型:多 benchmark 被干废是否等同于最高智能

GPT-6 Astra 被描述为“直接干废了三个 benchmark”,但公开信息主要详细描述了 ARC-AGI-3 的成绩。其他两个基准的具体名称和分数并未在可用信号中给出明确数据,因此无法判断“干废”到底是全面领先还是局部突破。

单一或少数基准上的压倒性胜利不等于整体智能最高。历史经验显示,很多模型在特定测试上取得高分后,在实际部署中暴露出明显短板。智能是多维度的,编程能力、数学推理、常识理解、创造性任务、鲁棒性等都需要综合评估。

目前信息仅支持 Astra 在 ARC-AGI-3 上大幅领先前代,但没有给出它与当前最强竞品 o1 或者 Claude 3.5 在相同条件下的直接对比。缺少这些横向数据,就难以得出“目前智能程度最高”的确定结论。

“最高智能”本身也是一个模糊概念。不同用户对智能的定义不同,有人看重推理深度,有人看重速度和成本,有人看重实际生产力。仅凭几个基准分数无法覆盖所有维度。

中文开发者目前能获取的实际使用信息

在 OpenAI 采取如发布策略的阶段,中文开发者暂时无法直接访问 GPT-6 Astra。能接触到的主要是 Zhihu 等平台上的二手讨论,以及官方释放的少量 benchmark 数据。

目前可靠信息主要集中在 ARC-AGI-3 的 7.8% 到 62.7% 以及 99.9% 的分数变化。这些数字来自公开回答,尚未看到 OpenAI 官方完整论文或可复现的测试代码。开发者需要谨慎对待,等待更多第三方验证。

营销控场导致早期信息高度正面,真实局限性讨论较少。中文社区目前能看到的实际使用报告非常有限,大多是基于营销材料的解读。

开发者目前最好保持观望,收集更多来自不同基准、不同真实任务的报告后再做判断。基准饱和不等于万能,在代码生成、复杂工程任务、长上下文理解等具体场景中的表现,仍需等待模型真正开放后的反馈。

整体来看,GPT-6 Astra 在特定基准上取得显著进步,但“最高智能”这一判断目前证据仍不充分。OpenAI 的发布策略进一步增加了获取客观信息的难度。

参考来源