AlphaGo核心作者:十年了,LLM还没学到那场棋局「神之一手」的精华
2016 年 3 月,首尔四季酒店。 人机大战第二局进行到中途,AlphaGo 把一颗黑子落在了第五线上。现场解说一时语塞,有人怀疑程序出了 bug,因为在职业棋手的常识里,这手棋近乎于白送。 后来的故事大家都知道了。AlphaGo 不仅赢下了那一局,还以 4:1 的总比分击败了李世石。赛后李世石说了一段被反复引用的话:「我原以为 AlphaGo 只是基于概率计算的机器。但看到那一手,我改变了想法。AlphaGo 一定有创造力。」 那就是著名的第 37 手。 十年过去,当年亲手造出 AlphaGo 的人却站出来说了一句:那一手棋所依赖的能力,今天的 AI 恰恰没有。 说这话的人是 Thore Graepel,AlphaGo 的核心作者之一,长期从事机器学习研究。最近他做了一个颇耐人寻味的决定 —— 离开 Google DeepMind,去创业做一件他认为更要紧的事:给机器装上真正的推理能力。 那个辛辣的观点出自他最近发布在 MIT Technology Review 上的一篇文章,文章标题非常直接,就叫「别被骗了 ——LLMs 不会推理」。看完这篇文章,图灵奖得主 Yann LeCun 表示赞赏,强调「真正的推理必须涉及搜索,LLM 不具备这一能力」。 Thore Graepel 为什么这么说?我们一起来看看这篇文章写了什么。 第 37 手不是「灵光一闪」,而是推理的产物 很多人对第 37 手的叙事是「机器直觉的神话时刻」——AI 电光石火之间,看到了人类千年棋谱之外的妙手。Graepel 说,这是大家对 AlphaGo 最大的误解。 要理解这一点,得先拆开 AlphaGo 的内部构造。它由两套系统组成:一套是策略网络(policy network),通过学习海量人类棋谱,来预测「高手在这一局面会怎么下」,这是直觉的部分。另一套是搜索机制,它不关心某手棋「看起来像不像人下的」,而是显式地构建一棵包含数千个分支的博弈树,逐一推演每个候选落点通向的未来。 关键在于:在策略网络眼里,第 37 手平平无奇 —— 职业人类棋手下出这一手的概率大约只有万分之一。如果只听直觉的,这一手根本不会被选中。是搜索机制在深算之后发现,这手「不像话」的棋通向一个更好的终局。 Graepel 借用了卡尼曼那个著名的框架来解释这件事。人类的思考分为两种模式:系统 1 快、凭直觉、毫不费力;系统 2 慢、一步步来、审慎权衡。AlphaGo 恰好是这两种模式在机器上的罕见合体:神经网络提供「这手棋有戏」「这个局面要赢」的直觉,搜索机制负责把这些直觉放到未来的攻防变化里去检验。缺了任何一半都不行:光有直觉,永远走不出第 37 手;光有暴力搜索,也根本筛不动围棋那天文数字般的可能性。 这里还有一个常被忽略的对比。1997 年深蓝击败卡斯帕罗夫,靠的是人类硬编码的规则,每秒评估 2 亿个棋局位置,向前看六到八步。而围棋的复杂度完全是另一个量级,一颗子的价值取决于几十个回合之后厚势与实地的消长,哪怕只算所有变化的一小部分,超级计算机也得算上几十亿年。所以 AlphaGo 必须学会「一眼看清局势」,甚至创造人类从未想过的下法。它不是靠算力碾压赢的,这一点至关重要。 大语言模型:一个被练到极致的系统 1 再来看今天的 AI。 大语言模型的工作原理,归根到底是一遍又一遍地预测下一个 token。这本质上就是系统 1 在运转:快速、联想式、在几乎所有人类写过的领域里都能完成令人惊艳的模式补全,但它没有「想一想再回答」这个环节。 ChatGPT 横空出世后不久,业界就意识到光有语言流畅度撑不起真正的用处。补救方案大家都很熟悉了:让模型别急着回答,先生成中间步骤,把问题拆开、把中间结果带下去 —— 也就是思维链(chain of thought)。 思维链的提升是实打实的,尤其在数学和代码上。但 Graepel 指出了一个容易被兴奋情绪掩盖的事实:这些中间推理步骤,仍然是同一个「预测下一个 token」的过程,只是在给出最终答案前多迭代了一会儿而已。 它并没有像 AlphaGo 的搜索那样,引入一个真正独立的推理机制。直觉被拉长了,但并没有因此变成审慎。 他进一步列出三个短板,说明聊天机器人做的事为什么够不上「科学家所承认的那种推理」。 第一,模型没有一份明确的、可持续更新的、可供检查的认知状态。它此刻在考虑哪些假设、对各种解释抱有多大信心、在权衡哪些证据、还有哪些问题悬而未决。这些东西本该随着新信息的到来被系统性修订,但模型内部并没有这样一本「开放的账簿」。 第二,模型没有做到「知道什么」和「如何运用知识」之间的分离。知识和推理死死缠绕在神经网络的权重里,不存在一套独立、显式表达的信念体系。 第三,也是最微妙的:思维链看起来像深思熟虑,但研究已经表明,模型经常在事后编造它们。
曼联铁闸将续约,卡里克视之为自己的朴智星!曾为穆帅决定落泪
提供篮球健康体验活动,包括篮球运动后的水疗放松、团队互动体验等。...
他曾被视为下赛季上港首先要清洗的球员!结果靠努力改命,值得期待
提供篮球健康体验活动,包括篮球运动后的水疗放松、团队互动体验等。...