有据可查的 AI 新闻、模型与产品English
新闻重大 研究2016年3月15日

AlphaGo 以 4:1 战胜李世石,比专家预期早了好几年

DeepMind 的 AlphaGo 在首尔以 4 比 1 战胜 18 次世界冠军得主李世石。围棋约有 10 的 170 次方种可能局面,赛前多数专家认为电脑至少还要五到十年才能赢顶尖棋手;它那步「人类万分之一才会下」的第 37 手,证明机器不只会计算,也能做出有创造性的判断。

发生了什么

围棋棋手李世石微笑的半身照
李世石,摄于 2016 年 5 月,比赛结束两个月后。 照片:LG Electronics / Wikimedia Commons,CC BY 2.0

2016 年 3 月 9 日至 15 日,韩国首尔四季酒店。对局一方是李世石:九段职业棋手,赢过 18 个国际冠军,被视为围棋史上最强的棋手之一。另一方是 Google 旗下 DeepMind 开发的程序 AlphaGo,它坐在棋盘对面的「代言人」是团队成员黄士杰,负责照着电脑屏幕落子。

比赛五局,奖金 100 万美元。结果 AlphaGo 赢了第 1、2、3、5 局,李世石赢下第 4 局,五局全部以一方认输结束。

总比分(AlphaGo 对李世石)
4 : 1
全球观看人数(DeepMind 数据)
2 亿+
围棋可能的局面数
10¹⁷⁰
第 37 手被人类下出的概率
万分之一

来源:DeepMind AlphaGo 项目页;维基百科「AlphaGo versus Lee Sedol」

局 日期 执黑 结果 看点
第 1 局 3 月 9 日 李世石 AlphaGo 胜 李世石大部分时间领先,最后 20 分钟被逆转
第 2 局 3 月 10 日 AlphaGo AlphaGo 胜 AlphaGo 第 37 手出人意料,李世石长考
第 3 局 3 月 12 日 李世石 AlphaGo 胜 解说认为 AlphaGo「强得有点吓人」
第 4 局 3 月 13 日 AlphaGo 李世石胜 李世石第 78 手扭转局面,人类唯一一胜
第 5 局 3 月 15 日 李世石 AlphaGo 胜 胶着局,AlphaGo 靠官子取胜

赛后,韩国棋院授予 AlphaGo 名誉九段。DeepMind 把 100 万美元奖金捐给了联合国儿童基金会等慈善机构和围棋组织;李世石拿到 17 万美元出场费和胜局奖金。

有多厉害:为什么说「早来了十年」

难度:不能靠「算」赢

1997 年 IBM 的「深蓝」战胜国际象棋世界冠军卡斯帕罗夫(见《深蓝击败国际象棋世界冠军》),靠的主要是超快的计算:每一步搜索海量走法,挑出最好的。这招在围棋上行不通。

围棋棋盘有 19×19 = 361 个交叉点,开局时每一步都有数百个位置可选,一盘棋通常要下一两百手。DeepMind 估算围棋的可能局面约有 10 的 170 次方种,比可观测宇宙中的原子数还多,是国际象棋的「一个古戈尔倍」(10 的 100 次方倍)。再快的电脑也不可能把它们算一遍。

更麻烦的是「判断形势」。国际象棋可以数子力、看王的安全;围棋高手判断局面靠的往往是一种说不清的「棋感」。1965 年数学家 I. J. 古德就写过:让电脑下出「像样的」围棋,比下国际象棋难得多,因为好的围棋原则「更定性、更神秘,更依赖判断」。

所以在 2015 年以前,最好的围棋程序只有业余段位,赢职业九段要被让四五个子。赛前,绝大多数观察者都看好李世石;据维基百科汇总,多数专家认为像 AlphaGo 这样强的程序至少还要五年,有人认为要十年。李世石本人赛前预测自己会「压倒性」获胜。

对比:AlphaGo 自己的进步有多快

衡量棋力常用「等级分」(Elo):分差 200 分,强的一方大约有 75% 的胜率;分差 400 分,约 90%。DeepMind 在 2017 年的《自然》论文中公布了各个版本的等级分:

AlphaGo 各版本的等级分(Elo)越高越强;括号内为对外战绩
  • AlphaGo Fan(2015.10,5:0 樊麾)3,144
  • AlphaGo Lee(2016.3,4:1 李世石)3,739
  • AlphaGo Master(2017,网上 60 连胜)4,858
  • AlphaGo Zero(2017.10,100:0 胜 Lee 版)5,185

等级分由 DeepMind 根据各版本之间的对局估算,与人类棋手的等级分体系不完全可比。 来源:Silver 等,《自然》2017(AlphaGo Zero 论文),经维基百科「AlphaGo」词条汇总

从 2015 年 10 月赢下欧洲冠军樊麾(职业二段),到 2016 年 3 月赢下李世石(职业九段),只隔了五个月。而击败李世石的版本,一年半后被不再学习人类棋谱的 AlphaGo Zero 以 100 比 0 横扫。

第 37 手:一步「人类不会下」的棋

第 2 局,AlphaGo 执黑。第 37 手,它把子落在了右边第五线上,一个职业棋手几乎不会考虑的「肩冲」。英文解说、美籍职业九段迈克尔·雷蒙称这手棋「有创造性」「独一无二」。李世石用了异常长的时间才回应。

DeepMind 后来披露,按照 AlphaGo 从人类棋谱学到的估计,人类下出这一手的概率只有万分之一。它还是下了,因为它自己的判断认为这样赢面更大。这盘棋最终 AlphaGo 获胜,李世石赛后说:「AlphaGo 下了一盘近乎完美的棋。」

下面是第 2 局的完整棋谱。可以按 ▶ 一步步看,或者直接点「跳到第 37 手」:

第 2 局(2016 年 3 月 10 日):AlphaGo 执黑● AlphaGo ○ 李世石

棋谱:Google DeepMind 挑战赛第 2 局,SGF 记录取自 CWI 围棋棋谱库。棋盘为本站根据棋谱绘制。

第 78 手:人类的唯一一胜

连输三局后,李世石在第 4 局改变策略:先拿边角实地,再深入 AlphaGo 的势力范围,制造「要么全赢、要么全输」的复杂局面。第 78 手,他在中央下出一记「挖」,中国棋手古力称之为「神之一手」。DeepMind 后来披露,这一手同样只有约万分之一的概率被下出。

AlphaGo 的应对出了问题:第 79 手时它还估计自己有 70% 的胜率,到第 87 手才突然发现形势急转直下,接着连续下出几步明显的坏棋。这盘棋李世石获胜。他说这是一场「拿什么都不换的胜利」。

第 4 局(2016 年 3 月 13 日):李世石执白● AlphaGo ○ 李世石

棋谱:Google DeepMind 挑战赛第 4 局,SGF 记录取自 CWI 围棋棋谱库。棋盘为本站根据棋谱绘制。

AlphaGo 是怎么做到的

AlphaGo 没有人为写进去的「围棋规则手册」,它的判断是学出来的。过程大致分三步:

AlphaGo 怎么学会下棋
  1. 1模仿人类先看 16 万盘高水平业余棋手的对局、约 3000 万步棋,学会「高手通常会下哪里」。
  2. 2自己跟自己下再让不同版本的自己对弈数千万盘,赢了的下法加强,输了的减弱(强化学习)。
  3. 3两个直觉网络一个网络负责「这里值得考虑哪几步」,另一个负责「这个局面我赢面多大」。
  4. 4有选择地往前算下棋时只顺着最有希望的几条路往下推演(蒙特卡洛树搜索),而不是穷举。

来源:维基百科「AlphaGo」「AlphaGo versus Lee Sedol」词条,整理自 DeepMind 2016 年《自然》论文

关键在第三步:AlphaGo 有了类似人类「棋感」的东西,一眼就能排除大部分不靠谱的下法,再把计算集中在少数几条线上。对李世石时,它运行在 Google 的云服务器上,用了大量处理器和 Google 自研的 TPU 芯片。

它的一个特点也让观众困惑:它追求的是赢的概率最大,而不是赢的目数最多。如果一条路能以 80% 的把握赢 20 目,另一条能以 99% 的把握只赢 1.5 目,它会选后者。所以它领先时常下出看起来「软弱」的棋,其实是在稳稳收官。

之后发生了什么

从首尔到今天
  1. 12017 年初化名「Master」在网上与顶尖棋手快棋 60 战全胜。
  2. 22017 年 5 月在乌镇以 3:0 战胜当时世界排名第一的柯洁。
  3. 32017 年 10 月AlphaGo Zero 完全不看人类棋谱,自学 3 天后以 100:0 胜过李世石版。
  4. 42019 年 11 月李世石宣布退役:「就算我成为第一,也有一个无法战胜的存在。」

来源:维基百科「AlphaGo」「AlphaGo Zero」「Lee Sedol」词条

对 AI 研究: 用神经网络学「直觉」、再配合搜索和自我对弈,这套方法被 DeepMind 推广到国际象棋和将棋(AlphaZero);团队在深度学习上积累的经验,又用到了蛋白质结构预测上(AlphaFold 2)。DeepMind 首席执行官哈萨比斯后来因 AlphaFold 获得 2024 年诺贝尔化学奖(见《AI 研究获两项诺贝尔奖》)。今天大模型的「推理」训练,也大量使用了强化学习(见 o1)。

对围棋本身: 一项 2023 年发表在《美国国家科学院院刊》(PNAS)上的研究,分析了 1950 年至 2021 年职业棋手的 580 多万步棋,用超越人类的 AI 程序给每一步打分。结论是:在超人 AI 出现之后,人类棋手的决策质量显著提高,而且人们更多地下出前所未见的新招,这些新招的质量也更高。换句话说,AlphaGo 没有让围棋消失,而是把人类棋手从几百年的定式里「解放」了出来。

对李世石本人: 他在 2019 年退役。2024 年接受采访时他说:「输给 AI,在某种意义上意味着我的整个世界崩塌了……我再也无法享受下棋。」

对社会: 比赛结束两天后,韩国政府宣布未来五年投入 1 万亿韩元(约 8.6 亿美元)用于 AI 研究。深蓝团队的默里·坎贝尔则说,这是「一个时代的终结……棋类游戏差不多结束了,是时候往前走了」。

需要注意的地方

  • 它只会下围棋。 AlphaGo 是专门为围棋训练的系统,不会聊天、不会写作,和今天的 ChatGPT、Claude 不是一类东西。它证明的是方法的威力,而不是「通用智能」。
  • 它不是没有弱点。 第 4 局显示,AlphaGo 在遇到没预料到的妙手时会判断失误,评论者认为这与蒙特卡洛搜索会「剪掉」看似不重要的变化有关。
  • 算力不对等。 一边是一个人的大脑,另一边是 Google 数据中心里的大量芯片。这不影响结果,但说明这场比赛也是一场工程资源的展示。
  • 部分数字来自 DeepMind 自己。 「2 亿观众」「万分之一概率」和各版本等级分都是 DeepMind 公布的;比赛结果、棋谱则是公开的事实。

对今天的我们意味着什么

AlphaGo 是很多人第一次意识到「AI 可能在需要直觉的事情上超过人类」的时刻。十年后的今天,类似的事情正在编程、数学和科研中发生:2025 年,AI 在国际数学奥林匹克达到金牌水平(见《AI 在国际数学奥林匹克达到金牌水平》);2026 年,AI 开始声称证明了前沿数学难题(见《OpenAI 公开 700 多篇 AI 数学论文》)。

围棋界的经验或许是最值得记住的:AI 超过人类之后,围棋并没有消失,人类棋手反而借助 AI 下得更好了。前提是像他们那样,把 AI 当作老师和陪练,而不只是对手。

看完整纪录片

DeepMind 在 2020 年把获奖纪录片《AlphaGo》免费放到了官方 YouTube 频道,片中记录了首尔五局的全过程,包括第 37 手和第 78 手前后的现场。

获奖纪录片《AlphaGo》(2017)。 在 YouTube 打开点击后才会加载 YouTube;部分地区可能无法访问。

来源