在近期举办的“强化学习暑期学校”结业仪式上,图灵奖得主、强化学习领域先驱理查德·萨顿教授提出一个引人深思的观点:当前主流大语言模型缺乏自主目标与真实体验。这场由上海创智学院、上海交通大学人工智能学院及Openmind研究院联合主办的活动,成为萨顿首次在中国系统阐述其学术思想的重要平台。作为Openmind研究院首席科学家,他通过两周的课程向学员完整呈现了强化学习的理论框架。
萨顿对智能的定义延续了人工智能术语创始人约翰·麦卡锡的思路,强调其本质是“通过计算手段实现目标的能力”。他特别指出,人工智能系统与生物智能系统虽发展路径不同,但在认知本质上属于同一范畴。尽管当前机器认知水平尚处初级阶段,但他预测到2040年人类仅有50%概率能完全破解心智之谜,这种审慎态度体现了他对技术发展的深刻认知。
针对当前人工智能发展的核心缺陷,萨顿尖锐批评了将反馈简化为“奖励信号”的技术路径。他以恒温器为例解释:虽然人类会将其行为解读为“维持室温”的目标导向,但设备本身仅通过金属热胀冷缩的物理机制运作。这种类比揭示出当前AI系统的根本局限——它们既不理解自身行为的真实意义,也无法通过环境交互形成自主认知。真正的心智系统应当具备预测环境、主动干预和实现目标的能力。
在目标赋予机制方面,萨顿提出颠覆性观点:所谓“目标”本质上是观察者赋予的叙事解释。他通过对比机械工程师与普通用户对恒温器的不同认知,说明智能判断具有强烈的主观性。这种视角延伸到人类自身时,他指出既可以从神经活动层面分析行为,也可以用追求财富、安全等目标进行解读,两种方式在不同场景下都具有合理性。
基于上述理论,萨顿为人工智能发展指明两个关键方向:一是构建与真实物理世界的交互接口,使系统通过直接体验获得认知发展;二是借鉴动物行为学研究成果,赋予AI系统类似生物的本能驱动机制。他特别强调心理学研究的重要价值,指出强化学习理论正是源于心理学家对动物学习行为的百年观察,这些基础规律为算法设计提供了宝贵启示。
在学术交流环节,萨顿分享了独特的研究哲学。他以阿尔伯塔大学的科研经历为例,强调保持“探索性思维”的重要性:既要敢于突破理论边界,又要对基础问题保持孩童般的好奇。针对学员发展,他提出“雄心与谦逊平衡论”,认为过度保守会错失重大突破,而盲目自大则会导致研究偏离正确方向。这种辩证思维贯穿其整个学术生涯,成为他持续取得突破的关键因素。
作为深度学习先驱杰弗里·辛顿的同行者,萨顿始终强调跨学科研究的重要性。他建议人工智能从业者系统学习认知科学知识,特别是要理解生物进化形成的认知机制。在他看来,自然选择经过数亿年优化的神经结构,蕴含着比人类现有算法更高效的学习范式,这种生物智能与机器智能的融合将开启新的技术革命。