从 Harness 设计模式到递归自我改进:AI 工程进入新阶段

从 Harness 设计模式到递归自我改进:AI 工程进入新阶段

当 Agent 开始优化自己的脚手架,AI 工程进入新阶段。从 Harness 设计模式到递归自我改进,基于 Lilian Weng 2026 年前沿综述。Harness 帮助模型改进而不直接改写权重,三大设计模式包括工作流自动化、文件系统持久记忆、子 Agent 与后台任务。

递归自我改进的历史与近期路径

递归自我改进(RSI)正从概念走向实践。早期路径聚焦于模型自身权重的迭代,而近期发展转向通过外部系统实现改进。Harness 成为关键桥梁,它不直接改写模型权重,而是构建一层可优化的脚手架。

这一转变让 AI 系统能够自我迭代。模型改进 Harness 提供了一种安全路径,避免直接触碰核心参数。历史上的 RSI 尝试多停留在理论层面,近期路径则把重点放在运行时环境的持续优化上。

从脚手架到自我改进系统,Harness 标志着工程实践的跃进。Lilian Weng 的 2026 年前沿综述指出,这种模式让 Agent 获得自主演化能力,而非依赖外部人工干预。整个过程强调稳定性与可控性,权重保持不变,改进发生在外围结构。

Harness 三大设计模式构建 Agent 运行时

Harness 由三大设计模式构成,它们共同支撑 Agent 的运行时环境。这些模式成为构建自我改进系统的基石。

工作流自动化是第一个基石。它将重复任务转化为可执行流程,Agent 能够自主调度步骤,减少人为介入。自动化工作流让系统在面对复杂目标时保持一致性,同时为后续自我优化提供数据基础。

文件系统持久记忆构成第二个基石。不同于短暂的上下文窗口,持久记忆通过文件系统存储关键信息。Agent 可以随时读取历史记录,形成跨越会话的连续性。这种设计让自我改进拥有长期记忆,避免每次重启都从零开始。

子 Agent 与后台任务是第三个基石。主 Agent 可以派生出专门子 Agent,处理特定子任务。后台任务则在主流程之外 quietly 运行,收集数据或执行优化。这些组件共同形成分层架构,让 Harness 具备扩展性。

三大设计模式相互配合,构建出完整的 Agent 运行时。工作流自动化提供执行框架,持久记忆保障知识积累,子 Agent 与后台任务实现并行能力。当 Agent 开始优化自身脚手架时,这三个基石成为递归改进的落脚点。

上下文工程支撑 Harness 与自我改进

上下文工程在 Harness 与自我改进之间扮演连接角色。它确保 Agent 运行时与模型落地能力紧密结合。上下文工程涵盖窗口管理、提示优化与信息保留策略,直接影响 Harness 的效能。

在自我改进系统中,上下文工程决定 Agent 能记住多少历史、如何处理新信息。Harness 依赖稳定的上下文来驱动工作流自动化和持久记忆读取。没有可靠的上下文管理,子 Agent 难以获得必要背景,后台任务也无法有效积累洞见。

两个核心信号均强调上下文工程是把大模型落地为可用产品的关键环节。它连接抽象的自我改进理念与具体的工程实现。通过上下文工程,Harness 三大设计模式获得实际运行支撑,递归自我改进路径变得可操作。

上下文窗口构成与溢出处理策略

上下文窗口是 AI 的工作记忆。其构成可以通过可视化方式呈现,主流模型的容量存在明显差异。窗口像一块有限画布,输入内容不断累积,直到达到上限。

当窗口溢出时,需要采取处理策略。三种常见策略分别是直接截断、摘要压缩和选择性保留。每种策略各有利弊。

直接截断最简单,直接丢弃最早内容。优势在于实现成本低,缺点是可能丢失关键早期信息,导致 Agent 失去上下文连贯性。

摘要压缩通过提炼核心内容减少占用空间。优势是保留主要语义,缺点在于压缩过程可能引入偏差,摘要质量直接影响后续决策准确性。

选择性保留根据重要性评分保留部分内容。优势在于灵活平衡信息量与相关性,缺点是需要额外计算评分机制,增加系统复杂度。

三种策略的利弊对比显示,没有万能方案。实际 Harness 系统中往往组合使用,根据任务类型动态选择。上下文窗口的可视化模拟能帮助开发者直观理解溢出效果,从而优化自我改进流程。

Markdown 成为大模型首选格式的原因

大模型倾向选择 Markdown 作为主要格式。这背后是纯文本模型特性与排版需求的结合。

纯文本模型本质上处理字符序列。Markdown 提供轻量级结构标记,既保持纯文本兼容性,又能表达标题、列表、代码块等排版元素。这种平衡让模型输入输出都保持高效。

排版需求推动 Markdown 成为首选。相比纯 TXT 缺乏结构,Markdown 能清晰分隔内容层次,方便 Agent 解析和生成。HTML 虽然功能更强,但标签复杂,增加 token 消耗。Word 和 LaTeX 格式则更重,不适合实时交互场景。

逐步推演显示,纯文本模型加上适度排版需求,最终指向 Markdown。Harness 系统中的工作流自动化和持久记忆大量使用 Markdown 存储提示和工作记录,这种格式选择直接服务于自我改进效率。

Agent 设计、工具调用与五层成本优化

Agent 设计是 Harness 落地的核心环节。它涉及角色定义、状态管理与决策流程。良好设计的 Agent 能有效利用工具调用,扩展自身能力边界。

工具调用让 Agent 突破纯语言限制,接入外部 API、数据库或计算资源。在自我改进场景中,工具调用可用于读取持久记忆、触发后台任务或优化工作流。设计时需考虑调用可靠性与错误处理,避免工具失败导致整个 Harness 崩溃。

五层成本优化体系贯穿整个落地过程。第一层关注上下文长度,减少不必要 token。第二层优化提示结构,避免冗余描述。第三层精简工具调用次数,只在必要时触发。第四层利用缓存机制复用计算结果。第五层通过模型路由选择合适容量模型,平衡效果与开销。

这五层体系与 Harness 三大设计模式紧密配合。工作流自动化可嵌入成本控制节点,持久记忆帮助避免重复计算,子 Agent 则可专注特定优化任务。整体形成从设计到部署再到持续改进的闭环。

递归自我改进不再是遥远概念。通过 Harness,AI 工程获得具体抓手。Lilian Weng 2026 年前沿综述为这一方向提供理论支撑,而实际落地依赖上下文工程、Agent 设计与成本优化体系的协同。当 Agent 能够优化自己的脚手架时,整个领域将迎来更深层次的演进。

相关阅读