从完成任务到自主发现,Agent后训练寻找下一个Scaling Law

从完成任务到自主发现,Agent后训练寻找下一个Scaling Law

2026年9月12日上午,Inclusion·外滩大会上以“Agent Post-Training:智能本质与下一个 Scaling Law”为主题的见解论坛正式举行。当大模型开始调用工具、执行复杂任务,衡量其能力的标准也在发生变化:不仅要看能否给出正确答案,更要看能否在真实环境中持续行动、检查结果,并根据反馈调整策略。从模型能力到任务价值,这一转变需要怎样的训练方法与基础设施?智能体能否在工作中积累经验、不断进化,进而打开新的能力增长空间?论坛围绕这些议题展开交流。

能力衡量标准从答案正确性转向环境适应性

大模型能力评估正经历根本转变。过去主要考察模型能否输出正确答案,如今重点转向真实环境中的表现。智能体需要持续行动、检查执行结果,并根据反馈实时调整策略。这种新评估维度强调适应性和持久性,而非单一答案准确率。

论坛指出,这一变化反映出从静态问答到动态任务执行的演进。智能体在复杂场景中必须处理不确定性,验证行动后果,并迭代优化路径。这样的衡量方式更贴近实际应用价值,也对后续训练提出更高要求。

从模型能力到任务价值的训练方法需求

从完成任务到自主发现,Agent后训练寻找下一个Scaling Law:从模型能力到任务价值的训练方法需求

能力评估标准的转变直接驱动训练方法的调整。从聚焦模型内在能力转向强调任务完成价值,需要开发新的后训练范式。传统监督或强化学习可能不足以支撑智能体在开放环境中的长期运作。

论坛讨论中提到,训练过程需融入更多反馈循环机制,让智能体学会从行动结果中提炼经验。方法上可能涉及多轮交互训练、策略优化以及价值函数重构,以匹配从答案正确性到环境适应性的新标准。这种转变旨在让智能体不仅能完成给定任务,还能在真实场景中创造实际价值。

基础设施支撑Agent持续行动与反馈循环

从完成任务到自主发现,Agent后训练寻找下一个Scaling Law:基础设施支撑Agent持续行动与反馈循环

训练方法的升级离不开配套基础设施。大模型转向复杂任务执行后,基础设施需支持长时间运行、实时反馈采集以及大规模交互模拟。没有坚实的基础设施,智能体难以在训练中建立稳定的行动-反馈闭环。

论坛强调,基础设施建设是实现从模型能力到任务价值转变的关键支撑。它需要提供可靠的计算资源、环境模拟平台以及数据流转系统,确保智能体能在接近真实的环境中反复练习、记录结果并优化策略。只有基础设施到位,后训练才能高效落地。

智能体在工作中积累经验的自我进化路径

从完成任务到自主发现,Agent后训练寻找下一个Scaling Law:智能体在工作中积累经验的自我进化路径

智能体能否在实际工作中积累经验并不断进化,成为论坛关注的核心。传统模型训练多依赖外部标注数据,而后训练阶段有望让智能体通过执行任务自然积累洞察,实现自我迭代。

这种进化路径依赖于持续的行动与反馈。智能体在完成任务过程中检查结果、调整策略,逐步构建内部知识库。论坛探讨了这一机制打开新能力增长空间的可能性:当积累达到一定规模,智能体或能自主发现新任务、优化自身架构,从而突破现有性能瓶颈。

算法层面支撑Agent后训练的核心创新

从完成任务到自主发现,Agent后训练寻找下一个Scaling Law:算法层面支撑Agent后训练的核心创新

算法是Agent后训练的底层驱动。论坛围绕算法议题展开交流,聚焦如何设计高效的后训练流程以支持复杂任务执行。算法创新需解决反馈延迟、探索-利用平衡以及长期信用分配等问题。

与传统预训练不同,后训练算法更注重在线学习和策略精炼。参与者讨论了可能的方向,包括增强探索机制的强化学习变体、基于结果验证的自我监督信号以及多智能体协作算法。这些创新旨在让算法更好地服务于从答案正确到环境适应的转变,为智能体提供持续进化的计算基础。

环境构建如何赋能Agent后训练迭代

从完成任务到自主发现,Agent后训练寻找下一个Scaling Law:环境构建如何赋能Agent后训练迭代

高质量环境是Agent后训练迭代的必要条件。论坛围绕环境议题进行讨论,指出环境需模拟真实世界的复杂性、提供丰富反馈信号,并支持安全可控的试错过程。

构建合适的环境能让智能体在训练中反复实践持续行动、结果检查和策略调整。环境不仅包括虚拟模拟,还可能涉及与物理世界或现有系统的交互接口。通过精心设计的环境,训练迭代效率显著提升,智能体得以更快积累经验并形成稳定行为模式。

下一个Scaling Law在自我进化中的潜在突破

论坛主题直指智能本质与下一个Scaling Law。当前Scaling Law主要依赖数据和算力增长,而Agent后训练下的自我进化或能开辟新路径。智能体在工作中积累经验、不断调整策略的过程,可能催生出超越单纯规模扩张的能力跃升。

当智能体实现自主发现和自我迭代,能力增长或不再严格受限于外部数据规模,而是通过内部反馈循环实现指数级进步。论坛交流显示,这一潜在突破依赖于算法、环境、基础设施与进化机制的协同。参与者期待通过后训练探索,找到驱动智能体能力持续扩张的新Scaling Law。

论坛邀请模型研究者、开发者及行业专家共同交流,虽未形成最终结论,但清晰勾勒出Agent后训练从任务完成走向自主发现的演进方向。这一领域的发展或将重塑人工智能的增长范式。

相关阅读