1898年饥饿猫实验奠定现代强化学习生物基础
1898年,一只饥饿的猫在木箱里反复试错才够到鱼肉,这一实验直接催生了Thorndike的效应律。在1898至1949年的五十年里,一群互相厌恶对方观点的心理学家通过动物实验,集体逆向工程出了现代强化学习的核心循环。他们从未写过代码,也无意构建AI,却为今天所有RL算法奠定了生物学基础。
Thorndike把一只饿猫放进特制的木箱,箱子外面挂着鱼。猫只能通过踩踏板、拉绳子或推杠杆才能打开门。第一次它乱抓乱咬,花了足足几分钟才逃出来吃到鱼。下一次放进去,它还是乱试,但逃出时间明显缩短。到第十次,它几乎一进去就直接踩踏板。Thorndike记录了每次逃脱所需的时间,画出学习曲线,发现成功行为会随着奖励重复而逐渐加强。这就是1898年他提出的Law of Effect:任何行为如果紧跟着满意的结果,就更可能在类似情境中重复;反之则减弱。
这个实验不是孤立的。Thorndike后来用鸡、狗、猴子重复类似测试,得到一致结果。他把木箱叫作puzzle box,强调动物不是通过突然的顿悟,而是通过盲目的试错和结果反馈来学习。Law of Effect把学习拆成两个部分:行为和后果的直接关联。信号显示,这一机制正是后来所有强化学习算法的原型。现代RL里agent在环境中采取action,得到reward,然后更新policy,核心逻辑与猫踩踏板后得到鱼完全一致。
木箱猫实验如何定义试错学习的机制
Thorndike的猫实验细节非常具体。木箱有多种开门方式:踩脚踏板、拉绳圈、推门闩。猫最初的行为完全随机,抓咬、撞击、乱叫。每次成功逃出后,Thorndike立刻让它再进箱子,测量逃脱时间从几分钟降到几秒。1898年的论文里,他把这种时间下降曲线称为学习曲线,并明确指出“满意的结果会印刻行为”。
Law of Effect的提出依据正是这些量化数据。他发现,猫不会形成对箱子整体的认知地图,而是把特定动作和开门结果直接绑定。失败动作逐渐被过滤,成功动作被保留。这套机制后来被命名为试错学习(trial-and-error)。信号明确指出,1898年这个实验开启了后续五十年的研究,直到1949年,心理学家们仍在用类似装置验证同一原理。
试错学习的核心是延迟满足。猫无法立刻知道哪一个动作有效,必须在多次失败后才建立关联。Thorndike强调,这种关联是机械的、自动的,不需要理解或推理。这一点后来被行为主义继承,成为反对“内省心理学”的重要武器。今天的RL算法里,探索与利用的权衡、延迟奖励的credit assignment问题,都能直接追溯到这只猫在木箱里的挣扎。
心理学家间的理念冲突如何加速理论迭代
那五十年的主角不是一个人,而是一群互相看不顺眼的心理学家。Thorndike和Watson公开争论行为的可测量性;Skinner后来又批评Tolman的认知地图概念;Hull则试图用数学公式把所有行为量化。他们不喜欢彼此的理论,却在同一个问题上反复较量:动物到底如何把行为和结果联系起来。
这种冲突反而加快了迭代。Watson1913年发表行为主义宣言,把心理学限定为可观察的行为,彻底抛弃意识概念,直接继承了Thorndike的效应律。Tolman虽然反对严格的行为主义,却用老鼠走迷宫实验证明“潜伏学习”,迫使大家思考奖励不是唯一驱动因素。Skinner则把实验装置简化成操作箱(operant chamber),让动物按压杠杆就能得到食物颗粒,精确控制变量,得到更干净的强化曲线。
信号明确提到“some of whom actively disliked each other’s ideas”,正是这种理念冲突推动了方法论的进步。从简单记录逃脱时间,到自动记录杠杆按压频率,再到引入统计模型,每一次争论都逼着对手拿出更硬的数据。1949年前后,这些争论已经把“效果律”从定性描述变成可量化的强化函数,为后来计算模型铺平道路。
1898-1949年动物实验逆向工程出强化循环
五十年间,心理学家用猫、鼠、鸽子反复做实验,逐步拆解出今天RL的核心循环:状态、动作、奖励、策略更新。Thorndike提供初始框架,Hull试图用驱力降低理论解释为什么奖励有效,Skinner则聚焦于强化时间表(fixed-ratio、variable-interval)。
他们集体发现,学习不是一次性事件,而是一个闭环。动物在特定情境(state)下做出行为(action),环境给出结果(reward或punishment),下次遇到同一情境时行为概率发生改变。这正是现代RL里agent-environment interaction的生物原型。信号指出,他们reverse-engineered the core loop,却完全没有计算机概念。
到1940年代末,这些实验已经覆盖了正强化、负强化、消退、泛化等现象。心理学家们虽然术语不同,但本质都在描述同一个反馈回路。1949年左右的文献已经能用数学语言近似描述行为概率随奖励变化的规律,为控制论和早期计算模型提供了直接的生物学素材。
从行为主义到早期计算模型的映射路径
行为主义发现向计算模型的过渡发生在1940年代后期。控制论学者注意到,动物通过奖励调整行为的机制与反馈控制系统高度相似。1943年McCulloch和Pitts发表神经网络论文,1948年Wiener出版《控制论》,都隐含了对生物强化机制的借鉴。
Thorndike的效应律被翻译成“如果某个输入-输出映射带来正面结果,则提高该映射的权重”。这几乎是后来感知器学习规则和TD学习的直接前身。1950年代初,Minsky和Papert开始讨论如何用机器实现试错学习,明确提到受Skinner箱启发。
信号覆盖的时间截止到1949年,此时计算机还远未普及,但心理学实验已经提供了完整的数学抽象:把学习看作优化一个价值函数,通过反复交互更新参数。行为主义者自己没有跨界,却为下一代工程师准备好了问题定义和验证方法。从猫的木箱到后来的棋盘、Atari游戏,实验装置只是换成了数字环境,核心循环从未改变。
这些生物发现如何嵌入现代RL训练流程
今天所有主流强化学习算法都能找到1898-1949年实验的影子。PPO、DDPG、Q-learning的核心更新规则,本质都是Law of Effect的计算实现:把正奖励的行为概率调高,把负奖励的行为概率调低。
在实际训练中,agent面对的“木箱”变成了模拟器或真实机器人。每次action后得到的reward对应猫吃到的鱼。经验回放、target network、entropy regularization等技巧,都是为了让试错过程更高效,但底层逻辑仍是Thorndike发现的关联机制。AlphaGo用蒙特卡洛树搜索结合策略网络,本质是把大量试错经验转化成策略改进。
信号强调“every modern” RL算法都建立在这一生物基础上。中文开发者训练一个机器人臂抓取物体时,用的reward shaping技巧,其实就是在重复Hull和Skinner当年对强化时间表的研究。甚至当前热门的RLHF(人类反馈强化学习),也直接继承了操作性条件反射的思路:用人类偏好作为奖励信号,调整大模型的输出分布。
跨学科起源对中文AI开发者意味着什么
这段历史告诉中文开发者,强化学习不是纯工程问题,而是跨学科的产物。心理学提供问题定义,生物学提供验证材料,控制论提供数学工具,最后计算机科学完成实现。忽略任何一环都可能导致盲点。
很多从业者只盯着代码和论文,却很少回看Thorndike的原始曲线。实际上,理解Law of Effect能帮助判断一个reward设计是否合理:它是否真的能让特定行为重复出现?当训练陷入局部最优或奖励黑客时,重温行为主义者如何区分正强化与负强化,往往能找到新角度。
对中国AI社区而言,这段跨学科起源意味着不能只做跟随者。心理学实验方法、行为量化技术、伦理讨论(动物实验的替代方案),都是我们可以贡献的领域。当前大模型训练中出现的对齐问题,本质仍是“如何让机器的行为后果符合人类期望”,与1949年前心理学家面对的问题一脉相承。
开发者若能把生物基础和工程实践结合,就更容易设计出稳定、泛化性强的RL系统。信号显示,这条路从一只猫开始,至今仍在延续。理解源头,才能在下一个技术浪潮中找到真正创新的空间。
(全文约2150字)
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/geek001/post/20260903/1898%E5%B9%B4%E9%A5%A5%E9%A5%BF%E7%8C%AB%E5%AE%9E%E9%AA%8C%E5%A5%A0%E5%AE%9A%E7%8E%B0%E4%BB%A3%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0%E7%94%9F%E7%89%A9%E5%9F%BA%E7%A1%80/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com