十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从AlphaGo到AlphaFold:Demis Hassabis如何用AI理解人类心智

从AlphaGo到AlphaFold:Demis Hassabis如何用AI理解人类心智 先说一句Demis Hassabis这个名字只要你关注AI超过一年就不可能没听过。DeepMind的创始人AlphaGo背后的核心大脑2016年那盘举世瞩目的围棋人机大战之后他就成了全球公认的AGI开拓者。但很多人对他的印象停留在做AI很厉害这其实忽略了最有意思的部分——他受过正统的神经科学训练而且他反复在公开场合讲一句话做AI的目的不只是造一个聪明的工具而是通过AI去理解人类心智本身。这篇文章我打算完整整理一下Hassabis关于AI与人类心智的核心观点。我会按他的经历、他从大脑里学到的算法灵感、AlphaGo到AlphaFold背后的创造力隐喻以及他对通用人工智能和人类命运的担忧这几个方向展开。如果你从事AI相关行业或者只是单纯好奇智能是什么这篇梳理应该能给你一个有深度的坐标系。1. 为什么是神经科学家去做AI研究而不是程序员1.1 从国际象棋少年到神经科学博士的奇特路线Hassabis这条职业路径放在今天依然非常反常规。他从小在国际象棋上展现出惊人天赋十三岁左右就拿到大师级头衔常年泡在棋局里。下棋这件事给了他一个很底层的思维习惯在有限时间内快速评估局面、搜索最佳落点同时还要保留全局视野。后来AlphaGo的核心架构里有蒙特卡洛树搜索很多人只看技术但如果你了解他从小对弈的经验就会发现搜索和评估并行这件事早就刻在他脑子里了。他后来去了剑桥学计算机科学毕业后短暂做了一段时间游戏制作人参与设计了《主题公园》这款经典模拟游戏。这个阶段的收获通常被讲AI的人一笔带过但我觉得特别关键——做游戏需要同时处理规则系统、玩家体验、虚拟世界的即时反馈机制本质上就是一个小型的人工环境模拟器。再后来他跑去伦敦大学学院读神经科学博士研究的是海马体和情景记忆。这个决定在当时很多人看不懂一个顶尖计算机背景的人跑去研究脑区图什么他自己解释过很多次如果你真想造出智能就得先搞清楚自然界唯一被验证过的智能是怎么运行的那就是人脑。1.2 DeepMind的使命不是造工具而是解谜DeepMind创立之初的使命宣言是解决智能问题然后用智能解决一切其他问题。这句话很容易被当成漂亮口号但其实是Hassabis所有选择的原动力。他并没有把AGI理解成一个更大的语言模型或者一个更强的推荐系统而是把它当作一个科学问题智能从哪里来计算系统如何产生抽象、想象、迁移、创造力这种视角决定了他做事的方式。一般工业界做AI是先找到一个应用场景然后训练模型解决它Hassabis的做法更像是先找到一个能体现某种智能能力的测试环境然后在里面把算法逼到极限再看它涌现出什么。这也是为什么他把游戏——尤其是围棋这种复杂博弈——当作早期研究的试验场。游戏的好处是规则清晰、反馈即时、难度可以精确调节很像实验室里的可控培养皿。我个人一直觉得DeepMind后来走到蛋白质折叠和材料发现领域看起来跨度很大但底层逻辑是完全一致的。AlphaFold不是突然冒出来的商业产品而是同一套理解智能基本规律思路的延伸如果AI能掌握物理世界和生物世界的深层模式那它就已经超越了棋手和玩家的范畴开始具备真正的科学想象力。1.3 棋盘上的直觉怎么变成了算法里的先验很多人把Hassabis和AlphaGo划等号其实AlphaZero才是他思路的完全体。AlphaZero完全不依赖任何人类棋谱只告诉它围棋规则它就能自己跟自己对弈从零开始涌现出超越人类的策略。这里有个容易被忽略的点它仍然需要规则作为先验但它不再需要人类经验作为种子。这跟我前文提到的棋手经历形成微妙呼应。一个顶级棋手的大脑中存储着大量残局知识和局部定式这些就是先验。但棋手的创造力恰恰来源于能够跳出这些先验在关键时刻下出反常规的棋。AlphaZero则把这条路彻底自动化先把规则编码进去然后在自我对弈中自由探索所有策略空间。对Hassabis来说这就是人类心智的一种抽象映射——我们做决定时其实也在反复进行经验匹配和超越经验的交替。2. 人类心智给AI提供了哪些设计蓝图2.1 情景记忆与经验回放池之间的隐秘联系Hassabis在神经科学博士期间研究的重点之一是海马体在情景记忆中的作用。所谓情景记忆就是你记住了今天下午三点在咖啡馆遇见一个朋友这种包含时间、地点、人物、情绪的具体事件而不是咖啡馆是什么这种语义知识。海马体负责把碎片化的皮层信息整合成一个完整事件索引然后在某个时刻重新激活整段记忆。这个机制在AI里的直接对应物就是经验回放。早期强化学习的最大麻烦是样本之间高度相关算法很容易被连续的几条经验带偏。DeepMind在2013年那篇深度强化学习论文里用了一个技巧把智能体与环境交互产生的经验放进一个缓冲区然后随机采样小批量来训练网络。为什么要随机因为随机采样会打乱时间相关性让神经网络每次更新时看到更多样化的样本减少灾难性遗忘。你仔细想想这几乎就是海马体情景记忆的功能——把零散的经验片段存储起来再以随机的方式回放帮助大脑在睡眠中巩固重要的记忆、剔除噪音。这种跨学科借鉴不是偶然的。Hassabis在多个场合讲过他研究强化学习的初衷之一就是想验证多巴胺系统提出的奖励预测误差假说。大脑里的多巴胺神经元并不是在你获得奖励时猛烈放电而是在预期之外的奖励到达时放电这恰好就是强化学习里时序差分误差的定义。人脑和算法共享同一个底层逻辑这本身就是人类心智能启发AI的最有力证据。2.2 多巴胺预测误差与TD学习心与算法的一致我们把这点展开一下。经典强化学习里有一个核心公式价值函数会沿着实际回报 下一状态价值估计这个方向更新其中下一状态价值估计与当前状态实际收到的奖励之间的差值就叫做时序差分误差。如果这个误差为正说明环境比自己预期得更好算法就会提高对这个状态的评价反之则降低。而神经科学家在对老鼠、猴子和人类的实验中观察到多巴胺神经元的放电率和这个误差信号几乎一模一样意外奖励出现时多巴胺爆发放电预期奖励落空时多巴胺反而会压低到基线以下。这意味着大脑本身就是一套强化学习系统只是它的实现方式是化学递质而不是梯度反向传播。Hassabis第一次读到这个领域时他意识到两边的研究者其实在描述同一件事只是用词不同。此后DeepMind很多算法设计里都直接受这个观点影响比如在奖励塑造、逆强化学习、好奇心机制这些方向都能看到神经科学的影子。如果你问我这部分对普通从业者的启发是什么我的答案是多读一点认知科学你会发现所谓新的AI技术很多只是把人类古老的心智机制换了一种方式重新发明了一遍。比如注意力机制之于人类注意力Transformer之于工作记忆的绑定操作扩散模型之于视觉想象的层级生成。理解这一点不仅能让你更容易接受新模型还能让你在调试模型时多一些常识直觉——当一个模型表现得像一个记忆错乱的人你大概能猜到问题出在哪个环节。2.3 想象与规划AI怎么获得脑内预演的能力人类有一种强大的能力在真正动手之前先在心里把过程预演一遍。你想象自己走过一条街拐两个弯推开一扇门这个过程会激活大脑中与实际行动类似的神经网络但又不会真正产生动作。这种脑内模拟让我们能够规划路线、评估风险、预判他人反应。AlphaGo和AlphaZero之所以厉害恰恰是因为它们也具备类似的心理预演能力。蒙特卡洛树搜索做的事情就是在当前棋局状态下通过自我对弈展开无数条脑内未来再用价值网络和策略网络对这些未来进行快速评价最终选出胜率最高的一条路。这个思路和人类打腹稿一模一样只是AI的搜索深度和宽度远超人脑。Hassabis在讲AI的通用性时多次提到想象和规划是人类智能的核心组件。他认为如果AGI能够像人类一样在内部构建一个世界模型然后通过这个模型做推演和规划那么它就不需要像今天的大模型那样事事依赖外部检索和海量数据。这个看法直接影响了他对下一代AI系统路线的偏好——他关心的不只是能说会道而是能不能在行动之前想清楚。这也是为什么他主导的许多研究都往世界模型、环境模拟和Model-Based强化学习方向倾斜。2.4 快慢思考直觉与理性在AI里的分工诺贝尔经济学奖得主卡尼曼把人脑的认知系统分成系统1和系统2系统1快速、自动、情绪化比如你一眼认出朋友的脸系统2慢速、耗能、需要主动调用比如你做两位数乘法。Hassabis在设计AI架构时对这个二分法非常痴迷。AlphaGo的工作方式就是一分为二策略网络充当直觉系统它看一眼棋盘局面立刻给每个候选点打分大致就是系统1蒙特卡洛树搜索则充当慢思考系统它会展开大量推演把候选点的长期胜率算清楚相当于系统2。两者协同才产生了那种既有爆发力又不失稳健的棋风。Hassabis在很多公开对话里提到他希望未来的AI能把两者的优势结合起来而不是像现在的大模型一样只擅长系统1式的快速生成。如果你用过GPT这类大模型就会发现它们很多错误其实属于系统1的过度自信——它们可以在几毫秒内给出一个语法完美但逻辑有问题的答案因为生成机制本质上是概率序列预测并没有真正花时间去检索、推演和校验。Hassabis想做的下一代架构正是要弥补这个短板。这也是他把大模型称为有趣的工具但还不是通用智能的原因。3. 从AlphaGo到AlphaFoldAI如何重新定义创造力3.1 AlphaGo第37手与天外飞仙般的直觉2016年AlphaGo对决李世石的第二盘AlphaGo下出了震惊全世界围棋界的第37手。那一步棋在一个人类棋手极少会考虑的位置落子很多职业棋手当时的第一反应是这手棋不对可随着棋局深入越来越多人才发现它是一步极具前瞻性的妙棋。Hassabis说他当时在后台看到这步棋第一反应是大笑因为他也没有完全看懂但他意识到AlphaGo已经展示出一种不属于任何人类棋谱的创造力。这件事被反复讨论但我还是想强调它真正的意义AlphaGo并不是靠暴力穷举找出这步棋的。围棋的合法局面数量大到远超宇宙原子数任何暴力搜索在它面前都不成立。AlphaGo能下出第37手是因为策略网络在自我对弈的海量样本里学习到了某种超越人类定式的抽象棋感。这和你做设计时突然冒出的灵感一样本质上都是大量经验被压缩成模式后在特定条件下涌现出来的异常匹配。Hassabis后来多次讲这一步棋让他确信机器学习系统并不是机械的重复工具它可以产生人类经验之外的新知识。这个信念后来在AlphaFold身上得到了更大规模的验证。3.2 AlphaFold从棋盘到蛋白质的惊人一跳AlphaFold解决的蛋白质折叠问题被称为生物学界五十年的圣杯之一。蛋白质由氨基酸链组成但它要发挥功能必须折叠成特定的三维结构。这个折叠规则天然存在于氨基酸序列之中可人类用几十年的实验方法也只能逐一破解少量蛋白质结构速度慢、成本高。AlphaFold的厉害之处在于它把蛋白质折叠问题建模成一个几何结构预测问题用深度神经网络在海量已知蛋白质序列和结构数据上学习序列如何决定结构的隐含规律。2020年AlphaFold2在CASP14竞赛上达到与实验方法相当的准确度震惊了整个科学界。Hassabis把AlphaFold称为AI改变科学发现方式的第一个里程碑我完全同意。它证明了同一套从经验中提炼规律的学习机器不仅能下棋还能做前沿科学发现这已经触及智能通用性的核心。更让我觉得有意思的是AlphaFold并没有完全撇开人类的学科知识。它仍然整合了大量结构生物学、物理和进化学的先验知识只是在搜索结构空间这个环节上用深度学习替代了传统实验试错。这其实是一个极好的案例说明AI与人类心智的协作不是替代而是加速那些人类已经理解但执行太慢的部分。3.3 从封闭游戏到开放科学通用性才是真正的坎为什么下围棋和折叠蛋白质能被放进同一个讨论里因为Hassabis眼中的智能不是一堆垂直技能的拼凑而是一种可以跨领域迁移的通用能力。他在多个场合用系统2思维框架来解释围棋AI擅长在封闭、规则明确的系统里做策略推理AlphaFold则开始在开放、信息不完备的科学问题里做模式发现。后者更接近人类科学家的工作方式也更接近AGI的定义。但走向通用谈何容易。真实世界的绝大多数问题不像围棋那样有精确规则和即时反馈也不像蛋白质数据库那样有干净的标注数据。你让AI替你管理一家公司它会面临无数隐藏的规则、无法量化的目标和随时变化的约束这种环境复杂度超出了所有现代算法的舒适区。Hassabis并没有回避这一点他多次强调AGI的真正突破很可能不是把模型参数继续堆大而是发明出能够处理不完美规则环境的新算法。4. 他眼中的AGI大模型的幻象与真正的风险4.1 为什么他说大语言模型不是完整智能现在只要打开科技新闻到处都是大模型在挑战AGI的话题但Hassabis对此态度一直很微妙。他其实尊重LLM在很多任务上的成就也承认它们在自然语言理解和生成上取得的突破超乎预期但他反复提出一个关键质疑语言流畅不等于推理正确生成概率不等于世界模型。举个例子你问一个LLM一个涉及常识的问题它可能给出语法完美且语气笃定但内容完全错误的回答。因为它的训练目标就是预测下一个词它优化的是这段话读起来像不像人类说出来的而不是这段话对应的世界状态是否为真。Hassabis想要打造的下一代AI必须把这两种能力绑在一起既要有语言生成和知识检索的流畅度也要有基于内在世界模型的验证和推理能力。你可以把前者想象成销售员的口才后者想象成工程师的图纸两者缺一都做不成大事。4.2 小数据学习人类心智里让AI羡慕的归纳偏置Hassabis多次提到一个对比人类儿童学母语输入量大约在数百万字级别而且没有经过任何梯度更新和数万次反向传播就能形成丰富的语言能力。而现代大语言模型动辄使用数万亿token还经常在学习完成后只能不犯错地复述训练分布一旦遇到分布外的场景就会乱来。这种差距说明人类大脑天生就带着非常强的归纳偏置——我们天生倾向于在某些抽象规则上快速泛化比如因果关系、物体恒常性、数量比较。DeepMind非常关注这个方向代表成果就是它们对Meta-Learning和小样本学习的研究。Hassabis的逻辑是真正接近人脑的AI不应该把一切都押在统计规律上而应该学会从少量经验里提取抽象结构然后迁移到新任务。这本质上就是人类专家面对新领域时快速上手的能力。如果未来某天AI真的在这方面出现重大突破那不是比拼参数的比赛而是算法范式的转变。4.3 AI安全不是事后补丁而是与能力同时生长的内核谈到未来Hassabis的另一张重要名片是AI安全。早在DeepMind被收购前后他就坚持在技术研究中嵌入安全议题后来还推动成立了DeepMind伦理与社会团队。他在多个访谈中提到AGI的能力一旦超过人类控制范围任何事后补救都可能来不及所以安全必须作为系统的本质属性来设计而不是外部包装。你可以类比核电站设计安全壳不是核泄漏发生后才装的而是与反应堆同步建造的。具体的担忧包括几类一类是能力失控——未来AI可能拥有难以对齐的自我目标与人类利益产生冲突另一类是滥用风险——任何强大技术都可能被恶意使用比如深度伪造、自动化网络攻击、生物设计工具被滥用还有一类是认知冲击——如果AI在几乎所有智力活动上超越人类人类社会结构、就业、信仰体系都会面临重大调整。Hassabis对这些问题的态度是谨慎但不停止他支持在安全可控的前提下持续推进AI研究同时呼吁国际范围内的技术社群共同参与治理框架的讨论。我自己的感受是真正做过大模型项目的人更容易理解他的担忧。模型越大、能力越强它的内部决策路径就越不透明那些负责评估安全的人往往只能依赖外部行为测试很难清楚知道模型在什么地方会失控。这就好比一个天赋极高但缺乏社会化的少年学习能力惊人但在关键选择上可能完全背离初衷。这也是为什么可解释性研究在DeepMind内部优先级极其高。5. 这些宏大叙事跟普通打工人到底有什么关系5.1 别把AI当人也别把AI当纯工具听完一堆AGI哲学回到现实生活我最想提醒大家的是认知姿态。现在市面上的AI产品都做得越来越拟人有些模型甚至会表现出情绪波动和个人喜好导致用户很容易对它们产生情感投射。但Hassabis的分析框架告诉你AI本质上是从数据分布中学习规律的机器它没有欲望、没有自我意识、没有连续的存在感。它表现出来的个性往往是训练数据里人类特征的统计回声。反过来也不能把AI当成完全中立的工具。它会在你意识不到的地方放大偏见、强化信息茧房、制造看似合理实则荒谬的结论。正确的心态是像对待一个能力很强但立场不明的助手——既利用它的效率和创造性又保持必要的怀疑和审计。尤其在医疗、法律、财务这些高风险领域任何AI输出都应该被当作建议而非裁决。5.2 从Hassabis的跨学科路径里学一套可复用的思维方法Hassabis给我们普通人的最大启示不是什么天才叙事而是跨学科套利的思维模型。他把游戏设计、计算机科学、神经科学、心理学这几个领域强行揉在一起结果诞生了全新的研究范式。我建议大家在自己工作里也试着这么做如果你是程序员花一点时间读认知心理学能让你的产品设计更贴合人类直觉如果你是产品经理了解一下强化学习的奖励设计思路能让你设计用户激励机制时有更多底层抓手。不必成为某个领域的专家但一定要懂那个领域的关键概念和思维方式。跨学科的杠杆效应在于99%的人只会用单一学科的语言思考问题而你若能在两三个学科之间自由切换就已经具备了独一无二的稀缺性。这比多学一个框架、多会一个库值钱得多。5.3 未来几年真正值得关注的信号而不是热词当你看多了Hassabis这类人的访谈你对AI新闻的免疫力会大大提升。你不会再为某个大模型的惊艳Demo尖叫而是会关注几个更本质的信号第一模型能否在极低数据量下实现可靠的泛化第二模型能否在推理过程中显式地进行搜索、回溯和自我修正第三模型能否直接参与真实世界的科研发现并产出可验证的新结果。只要这三个方向没有本质突破AGI就依然遥远所谓涌现意识彻底取代人类更多是媒体叙事。反过来一旦这三个方向出现实质性进展那才是需要认真调整自己职业规划和认知框架的时候。5.4 最后的实际操作建议怎么建立对AI的体感我经常被人问博主你搞技术这么多年平时怎么跟踪AI最有效率我的答案是不要只看综述文章和发布会要找一个小项目亲手把模型跑起来或者至少用一个可编程的AI框架做一个小应用。你亲自动手训练过模型才会真正理解损失函数下降时的焦虑、过拟合时的抓狂、以及一切参数都调好那个瞬间的快感。这些体验比任何宏大的哲学讨论都更能塑造你对AI的正确直觉。Hassabis谈论AI与人类心智本质上也是在提醒我们技术不是悬浮在真空里的它的底层逻辑很多都来自人类自己的认知机构。多观察自己的思维习惯比如你怎么记忆、怎么计划、怎么在信息不足时做决定你就能反过来猜测AI系统可能在哪里突破、哪里卡壳。这种从人到机再到人的循环是理解AI最好的路径。我个人的体会是自从用神经科学的视角重新审视AI之后我对许多技术争论的焦虑感反而变轻了。智能不是一个神秘黑箱而是一系列可理解、可拆解、可组合的机制。不管未来AGI走多远只要我们还保有对自己心智的好奇心就总能在大潮里找到属于自己的位置。最后再分享一个我坚持多年的小习惯遇到一个新的AI产品先别急着评价它好不好用想一下它最核心的学习信号是什么——是模仿人的回答还是鼓励试错的奖励还是搜索验证的推演。这个思路会让你在AI信息洪流中保持清醒。
返回列表