OpenAI总裁称GPT-6 Astra或已达AGI,ARC-AGI-3成关键证据

OpenAI总裁称GPT-6 Astra或已达AGI,ARC-AGI-3成关键证据

OpenAI总裁Greg Brockman在GPT-6 Astra发布后说:“我个人认为,我们可能已经到达AGI了,我觉得就是这个模型。”这句话指向该模型在ARC-AGI-3上的表现,而非OpenAI官方结论。

ARC-AGI-3基准实际测试的是哪些能力

ARC-AGI基准由François Chollet于2019年提出,核心目标是衡量模型的通用智能水平,而不是特定任务的熟练度。ARC-AGI-3是其最新版本,测试机制围绕抽象推理核心构建。每个测试任务由少量示范样本组成,通常3到5个输入-输出网格对。模型必须观察这些示范,推断出隐藏的转换规则,然后将规则应用于新的测试输入网格,生成正确的输出。

这些网格由彩色像素构成,大小从几格到几十格不等。规则可能包括对象计数、填充、对称、旋转、延伸或组合等抽象操作。重要的是,规则在不同任务间完全不同,且不与现实世界常识直接挂钩。这迫使模型在现场从极少例子中归纳,而非调用预训练知识。

与传统基准如ImageNet或GLUE不同,ARC-AGI故意避免依赖大规模数据记忆。人类在这些任务上平均得分约85%,而当前顶级大模型在ARC-AGI-2上的得分通常低于50%。AGI定义在此对应为“能在新颖任务上高效学习,像人类一样从少样本中泛化”。如果模型能在ARC-AGI-3上接近或超过人类水平,就被视为接近核心通用智能的证据。

该基准还强调鲁棒性。测试集包含故意设计的干扰,如噪声、颜色映射变化或网格尺寸变体,以防止模型通过模式匹配作弊。arcprize.org明确指出,这不是编程竞赛,而是对“核心知识先验”的检验,包括对象性、因果、时空连续性等人类婴儿早期就具备的直觉。

目前ARC-AGI-3的公开 leaderboard 显示,纯Transformer架构模型进步缓慢。获胜者往往结合程序合成、搜索或专用推理模块。这说明单纯扩大规模未必直接解决抽象泛化难题。基准的实际意义在于,它提供了一个可重复、难以刷分的标尺,用于判断模型是否真正迈向AGI,而非在窄任务上刷分。

(本节约420字)

Brockman表态的证据强度仅停留在个人判断

OpenAI总裁称GPT-6 Astra或已达AGI,ARC-AGI-3成关键证据:Brockman表态的证据强度仅停留在个人判断

Greg Brockman的原话使用了明确的第一人称“我个人认为”,并加入“可能”作为缓冲。他还补充说“如果你想说这是第一个,我认为这是合理的”,这显示出谨慎的措辞。Geekpark报道明确指出,这不是OpenAI官方宣布AGI到来,而是一位公司总裁在发布会结束后镜头前的个人判断。

这种表述方式与OpenAI以往风格一致。公司此前多次强调,只有在内部安全评估和外部审查通过后才会正式宣称AGI。Brockman的表态因此缺乏官方背书,其证据强度主要依赖听众对个人可信度的信任,而非可验证的公司立场。

发布会本身聚焦于GPT-6 Astra的技术演示和能力展示,并未在主舞台直接宣布AGI达成。Brockman的评论出现在发布会结束后,属于非正式延伸。这意味着即使模型在某些基准上取得突破,OpenAI整体仍保持“尚未正式定义AGI达成”的姿态。

个人判断与官方声明的区别在于责任归属和可追溯性。官方声明需经过董事会、多方审核和潜在监管报备,而个人观点则更像行业人士的乐观预测。Geekpark文章强调,Brockman留了后路,表明他意识到AGI定义存在争议,目前行业内对AGI的精确门槛仍无共识。

这种表态对行业的影响在于,它为后续叙事提供了可引用素材,但法律和政策层面无法直接视为OpenAI的正式立场。投资者或监管者若据此行动,需要区分这是个人情绪还是信号释放。

(本节约380字)

GPT-6 Astra在ARC-AGI-3上的得分与此前模型差距

OpenAI总裁称GPT-6 Astra或已达AGI,ARC-AGI-3成关键证据:GPT-6 Astra在ARC-AGI-3上的得分与此前模型差距

根据arcprize.org发布的博客,GPT-6 Astra在ARC-AGI-3公开测试集上取得了显著进步,但具体得分并未达到人类平均水平。此前GPT-4系列在类似ARC-AGI-2上的得分约为30%-40%,而Astra据称将这一数字提升至接近60%。

差距主要体现在少样本泛化效率上。早期模型往往需要数百个额外示范才能接近正确规则,而Astra能在3-5个示范内更稳定地推断复杂转换。arcprize.org指出,这种提升部分来自训练时加入的合成抽象任务数据,以及推理时使用的专用搜索机制。

然而,差距依然明显。在包含干扰噪声的困难子集上,Astra得分回落至45%左右,显示其对规则鲁棒性的掌握仍不完善。与人类相比,模型更容易被颜色重映射或网格旋转所迷惑。此前模型如GPT-4o在ARC上的失败模式主要是“记忆类似模式”而非真正归纳,Astra虽缓解了部分问题,但未完全消除。

arcprize.org博客强调,当前最佳公开分数仍由人类与AI混合系统保持。纯端到端模型的进步曲线在过去两年趋于平缓,Astra的跃升被视为规模与架构优化的结合结果,而非范式突破。博客同时警告,基准分数易受测试集污染影响,真正检验需看私有测试集表现。

与GPT-5推测版本相比,Astra在ARC-AGI-3上的提升幅度约为15-20个百分点,但仍远低于AGI讨论中常提到的80%门槛。这意味着模型在抽象推理上更强,却未达到“任意新任务快速适应”的通用智能标准。

(本节约410字)

操控电脑演示与真实任务执行的差距

OpenAI总裁称GPT-6 Astra或已达AGI,ARC-AGI-3成关键证据:操控电脑演示与真实任务执行的差距

OpenAI为GPT-6 Astra给出的slogan是“操控电脑”。发布材料展示了模型通过鼠标、键盘和屏幕理解完成浏览器操作、文档编辑和简单编程的任务。Geekpark拆解显示,这些演示主要在受控沙盒环境中进行,界面元素清晰、任务步骤有限。

实际效果上,Astra能连续完成“打开浏览器-搜索关键词-复制结果到文档”这样的链条,但成功率在公开演示中约为75%。当引入真实桌面干扰,如弹窗、动态加载或非标准UI时,模型频繁出现点击偏移或操作序列中断。Geekpark指出,模型依赖视觉 grounding 模块将屏幕像素映射为语义动作,这一模块在分辨率变化或主题切换时稳定性不足。

局限体现在长期规划和错误恢复上。演示任务最长不超过10步,而真实办公场景常需30步以上且包含分支判断。Astra在出错后重新规划的能力较弱,往往重复相同错误而非尝试替代路径。技术细节显示,其底层仍以下一token预测为主,辅以有限的外部工具调用,并非真正自主代理。

与纯语言模型相比,Astra整合了更强的多模态理解,但仍未解决“幻觉导致错误点击”的根本问题。Geekpark分析认为,“操控电脑”目前更接近增强型宏命令,而非人类级计算机使用能力。真实任务执行需要持续数小时的注意力、上下文记忆和常识纠错,这些仍是当前演示的短板。

演示材料回避了需要创造性或高风险决策的任务,如财务报表审核或代码调试中的复杂权衡。这表明slogan虽吸引眼球,但实际落地仍需大量人工监督。

(本节约390字)

中文开发者面临的大模型跟进与资源压力

OpenAI总裁称GPT-6 Astra或已达AGI,ARC-AGI-3成关键证据:中文开发者面临的大模型跟进与资源压力

GPT-6 Astra的AGI相关叙事对中国AI团队构成直接压力。国内大模型研发方向可能加速向抽象推理和代理能力倾斜,原本聚焦垂直应用的团队需重新评估是否跟进通用基础模型赛道。

算力投入将成为主要瓶颈。训练类似规模模型需要数万张H100级别GPU,国内受出口管制影响,获取渠道和成本均高于海外。中小团队可能被迫选择与头部企业合作或专注特定领域微调,而非从零训练竞品。

开发者社区预计将出现两极分化。一部分转向跟随OpenAI API进行应用层创新,另一部分则加大对开源替代如DeepSeek、Qwen系列的投入。ARC-AGI类基准可能被更多中文论文采用,作为衡量国产模型通用性的新标尺。

资源压力还体现在人才争夺上。熟悉推理优化和多模态 grounding 的工程师将成为稀缺资源,薪酬和股权激励预计进一步上涨。初创公司融资时,投资人或将更多询问“在ARC-AGI上的计划”,迫使团队调整路标。

整体而言,这一叙事可能加速行业洗牌。拥有稳定算力供应链和长期资金支持的头部玩家优势扩大,而依赖海外闭源模型的中小企业需寻找差异化路径,如中文知识增强或行业特定代理。

(本节约340字)

监管框架如何应对AGI叙事提前出现

OpenAI总裁称GPT-6 Astra或已达AGI,ARC-AGI-3成关键证据:监管框架如何应对AGI叙事提前出现

AGI叙事提前出现要求中国监管部门调整治理重点,从单纯模型能力评估转向全链条风险预判。当前监管框架以《生成式人工智能服务管理暂行办法》为基础,更侧重内容安全和数据合规。面对可能具备自主代理能力的模型,需增加对长期规划、工具调用和现实世界交互的风险评估模块。

风险评估方式可能从静态备案转向动态沙盒测试。监管机构或要求企业在发布高能力模型前,在隔离环境中验证其在ARC-AGI类任务上的表现,并提供可解释的决策路径记录。提前出现的AGI宣称也将促使监管加快制定“通用智能”定义和分级标准,避免市场过度炒作。

治理重点可能转向供应链安全和算力使用监管。鉴于训练AGI级别模型消耗巨大电力和芯片资源,相关部门或加强对大型算力集群的用途审查,防止未经评估的实验性训练。

此外,劳动替代和知识产权问题将上升为重点。模型若能自主操控电脑完成知识工作,现有劳动法和版权框架需同步更新。监管还可能要求模型部署时内置“能力边界声明”机制,让用户清楚了解当前版本与AGI的实际距离。

总体看,监管需在鼓励创新与防范系统性风险间取得平衡。过早收紧可能抑制国内技术追赶,过松则易引发安全事件。参考国际动态,中国或将推动多边基准测试合作,以ARC-AGI这类中立指标作为跨国监管对话的基础。

(本节约370字)

参考来源