mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
5384 字
15 分钟
AlphaGo:自对弈征服围棋
2026-07-29

AlphaGo 系列论文解读:从人类棋谱到纯自对弈,一条通向通用强化学习的陡坡#

系列:AlphaGo(Nature 2016)→ AlphaGo Zero(Nature 2017)→ AlphaZero(arXiv<1712>.01815 / Science 2018) 作者:Google DeepMind,David Silver、Demis Hassabis 领衔 三篇论文是一条越走越快的斜坡。AlphaGo 证明”深度神经网络 + 树搜索”能击败人类顶尖棋手,AlphaGo Zero 砍掉人类棋谱、只留自对弈,AlphaZero 则把同一个算法原封不动搬去国际象棋和将棋,宣告一种通用强化学习范式的诞生。理解 DeepMind 后来在 AlphaFold 与 Gemini 上的方法论,钥匙都在这三篇里。


第一篇 AlphaGo:深度学习第一次踏平围棋#

论文:Mastering the game of Go with deep neural networks and tree search 作者:David Silver、Aja Huang、Demis Hassabis 等,Google DeepMind 2016 年 1 月 Nature 封面论文。用策略网络 + 价值网络 + 蒙特卡洛树搜索的组合,在 19×19 全尺寸棋盘上第一次击败职业棋手(对樊麾 5<0>),三个月后以 4<1> 战胜李世石,让深度学习第一次破圈进入大众视野。

一、问题:围棋凭什么难倒计算机这么多年#

国际象棋在 1997 年被深蓝攻克,围棋却一直守住了阵地。原因有两个:一是搜索宽度,围棋平均每个局面有约 250 个合法落点,合法棋局总数高达 10^170 量级,暴力搜索连边都摸不着;二是局面评估,围棋没有”子力价值”这类简单启发式,厚势、实地、气这些概念很难写成程序。

在 AlphaGo 之前,最好的围棋程序(同样基于蒙特卡洛树搜索)只相当于业余 5-6 段,离职业棋手有本质差距。业界普遍预期”再等十年”。

二、架构:双网络 + 树搜索的三板斧#

AlphaGo 的核心发现是:用深度学习替代传统启发式,把围棋变成”模式识别 + 搜索”两个问题的组合。整套系统由四块拼成:

  • 策略网络(Policy Network):一个 13 层的卷积神经网络(CNN),输入棋盘状态,输出每个落点的先验概率。CNN 擅长抓图像里的局部纹理,放到围棋棋盘上就是”棋感”——星位、小目、定式这些局部棋形,它一眼就能认出来。
  • 价值网络(Value Network):输入局面,输出一个标量,估计当前局面黑棋的胜率。它解决”评估难”,让树搜索不用一路模拟到底。
  • 快走子(Fast rollout):一个轻量的线性策略,速度比深度网络快约 1000 倍,用来补齐 MCTS 随机模拟阶段的采样效率。
  • 蒙特卡洛树搜索(MCTS):把上面三样串起来。树搜索按策略网络给的先验展开,用价值网络评估叶节点,再反向传播更新每个节点的访问次数和平均收益,最后按访问次数选点落子。

值得注意的是,这四件套没有一件是全新发明,MCTS、CNN、监督学习都是老技术。AlphaGo 的贡献是”系统级集成”——论文标题里”tree search”和”deep neural networks”并列,强调的是组合而非单点突破。

三、训练:人类棋谱打底,自对弈强化#

训练分三步走:

  1. 监督学习:先用约 3000 万个人类对局局面(来自 KGS 棋谱库)训练策略网络,让它学会”复刻”职业棋手的选点。这一步的产物叫 SL 策略网络。
  2. 强化学习:让 SL 策略网络与它自己的历史版本自对弈,用胜负结果做奖励信号,微调得到更强的 RL 策略网络。这一步把人类棋谱的上限顶开了。
  3. 价值网络:用 RL 网络自对弈生成的约 3000 万局面训练价值网络,目标是预测终局胜负。

算力账:论文正式描述的是击败樊麾(2015 年 10 月)的系统,分布式版用 1202 个 CPU + 176 个 GPU,单机版用 48 个 CPU + 8 个 GPU。三个月后打李世石时,团队把计算平台整体切换成 48 块第一代 TPU

四、成绩:樊麾 5<0>,李世石 4<1>#

  • 2015 年 10 月,5<0> 击败欧洲围棋冠军樊麾,这是计算机程序第一次在全尺寸棋盘上战胜职业棋手,比学界预期提前了约十年。
  • 论文测试中,AlphaGo 对其它围棋程序的胜率达到 99.8%;单机版 Elo 约 2895,分布式版约 3140。
  • 2016 年 3 月 9-15 日,首尔,4<1> 战胜李世石。这是引爆全球的头条事件。李世石唯一的胜利在第四局,第 78 手”挖”被称作”神之一手”,逼出了 AlphaGo 的弱点;但五局下来 AlphaGo 仍以 4<1> 拿下,Google 为之准备了 100 万美元 奖金。

五、这一作的局限#

回头看,第一代 AlphaGo 有三个明显短板:一是依赖人类棋谱,水平上限被 SL 网络锁死,学到的定式全是人类的;二是算力奢侈,上千 CPU/GPU 或几十块 TPU,训练周期长达数月;三是单机版与分布式版棋力差距明显,说明算法本身还不够”浓缩”。这些问题,都是下一篇 AlphaGo Zero 的靶子。

收尾:我的一点看法#

AlphaGo 这篇论文的技术含金量,很大程度上被”李世石大战”的热度掩盖了。它真正的贡献是确立了”深度网络提供直觉、树搜索负责推演”的分工范式——这个范式后来从棋盘一路走到了蛋白质、走到了大模型推理。

另一个容易被忽略的点是它的破圈价值。2016 年 3 月那场直播,把深度学习从实验室话题变成了全民话题,全球公众第一次直观感受到”AI 会思考”。对 DeepMind 自身而言,这场胜利确立了它在 Google 内部的技术话语权,也让 Hassabis 有了”DeepMind 的方法能解决真实世界问题”的底气——一年后 AlphaFold 立项,正是这股底气的产物。

附:核心数据速查#

架构配置

组件说明
策略网络13 层 CNN,SL 预训练(约 3000 万局面)后 RL 强化
价值网络自对弈 3000 万局面训练,输出胜率标量
快走子线性策略,速度约深网 1000 倍
搜索MCTS 整合以上三者

关键战绩

对手结果时间
樊麾(欧洲冠军)5<0>2015 年 10 月
其它围棋程序99.8% 胜率论文测试
李世石4<1>(第四局 78 手”神之一手”)2016 年 3 月

算力

  • 分布式版:1202 CPU + 176 GPU;单机版:48 CPU + 8 GPU
  • 打李世石版本:48 块第一代 TPU

关键概念清单

  • CNN = 卷积神经网络(提取局部棋形特征)
  • Policy Network = 策略网络(落子先验概率)
  • Value Network = 价值网络(局面胜率评估)
  • MCTS = Monte Carlo Tree Search,蒙特卡洛树搜索
  • rollout = 快走子(轻量快速模拟)
  • Elo = 棋力等级分
  • SL = Supervised Learning,监督学习;RL = Reinforcement Learning,强化学习

第二篇 AlphaGo Zero:不要人类棋谱,让规则自己长出棋力#

论文:Mastering the game of Go without human knowledge 作者:David Silver、Julian Schrittwieser、Karen Simonyan、Demis Hassabis 等 2017 年 10 月 Nature 封面论文。从一张白纸开始,只输入棋盘与规则,靠纯自对弈强化学习,3 天击败 AlphaGo Lee(100<0>),40 天以 89<11> 击败击败过柯洁的 AlphaGo Master。论文标题直白地宣告:人类知识不再是必需品。

一、问题:人类棋谱是捷径,也是天花板#

上一篇 AlphaGo 的成绩单让人兴奋,但 Hassabis 团队自己清楚:SL 网络把人类的棋风、定式、甚至人类的错误都教给了机器。AlphaGo Zero 要回答一个更根本的问题——给定规则,一个智能体能否从零开始自学到超人类水平? 这正是”强化学习”这一研究纲领的核心命题。

二、架构:单网络,双头,无快走子#

AlphaGo Zero 对架构做了三处大刀阔斧的简化:

  • 单网络替代双网络:策略头和价值头共享同一个主干,融合进一个神经网络,一起输出落子概率和胜率估计。
  • ResNet 替代 13 层 CNN:主干换成残差网络(ResNet),最强配置用了 40 个残差块(另有 20 块版本)。残差连接让深层网络好训练,棋力随深度稳步增长。
  • 去掉快走子:第一代的 rollout 被整个删除,树搜索的评估完全交给价值网络。少一个组件,系统反而更强、更纯粹。

输入也从 48 个手工特征简化为原始棋盘信息:最近 8 步双方的落子、当前执子方与合法步,共 17 个特征平面。没有任何人类棋谱、定式、棋感特征。

三、训练:纯自对弈,一台机器四块 TPU#

训练循环非常简洁:当前最优网络与自身对弈(每手思考 0.4 秒)→ 产生的对局数据喂给网络 → 网络训练成新版本 → 新版本继续自对弈。累计 约 490 万局自对弈后,训练宣告完成。

算力对比极其扎眼:第一代打李世石用 48 块 TPU 练了几个月;Zero 只用一台机器、4 块第一代 TPU,练几天就全面超越。

四、成绩:一条惊人的自我学习时间线#

论文里的学习曲线是全文最震撼的部分,短短 40 天,机器重演了人类数千年的围棋史:

  • 3 小时:还在乱下
  • 16-36 小时:自己”重新发明”了小雪崩定式、小目一间高挂等人类定式
  • 55 小时:发现人类从未用过的下法
  • 72 小时(3 天)100<0> 击败 AlphaGo Lee
  • 约 21 天:追平 AlphaGo Master 的水平
  • 40 天:以 89<11> 击败 AlphaGo Master(击败柯洁的版本)

柯洁得知后感慨”一个纯净、纯粹自我学习的 AlphaGo 是最强的……人类太多余了”。这句话比任何 benchmark 都有分量。

五、这一作的意义与局限#

AlphaGo Zero 证明了三件事:人类棋谱不是必需项;纯 RL 学到的棋力可以反超”人机混合”版本;算法效率的提升(少 12 倍的算力、少几个月的训练)可以碾压工程堆料。局限也很清楚:它仍然是围棋专用系统,规则写死在代码里;自对弈只在单一游戏内进行。从”专用”到”通用”,还差最后一步。

收尾:我的一点看法#

AlphaGo Zero 是这三篇里技术思想最激进的一篇。“无人类知识”是一个立场宣言:如果连围棋这种人类千年智慧的结晶都能从零自学超越,那么人类数据在很多场景下就不是必需品,而是起点、甚至绊脚石。这个思想后来直接影响了 DeepMind 一系列工作——AlphaZero 的通用化、MuZero 的”连规则都自己学”,乃至大模型时代对”从反馈中学习”的推崇。

值得注意的是它的工程美学:删掉快走子、合并双网络、去掉人类特征,每一次减法都带来能力加法。Hassabis 反复强调的”简化即力量”在这篇里体现得淋漓尽致。

附:核心数据速查#

架构配置

网络单网络(策略头 + 价值头共享 ResNet)
残差块20 / 40(最强版 40)
输入17 通道棋盘原始信息,无人类特征
快走子删除
硬件单机 4 块 TPU v1
自对弈约 490 万局,每手 0.4 秒

里程碑

时间事件
72 小时100<0> 击败 AlphaGo Lee
约 21 天达到 AlphaGo Master 水平
40 天89<11> 击败 AlphaGo Master

关键概念清单

  • ResNet = 残差网络(残差连接让深层网络可训练)
  • self-play = 自对弈(与自身历史版本对弈产生训练数据)
  • policy head / value head = 策略头 / 价值头
  • 特征平面 = 棋盘状态的通道化编码
  • Master = 2017 年击败柯洁的 AlphaGo 版本

第三篇 AlphaZero:一个算法,三种棋,零领域知识#

论文:Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm 作者:David Silver、Thomas Hubert、Julian Schrittwieser、Demis Hassabis 等 2017 年 12 月 arXiv 预印本(arXiv<1712>.01815),2018 年 12 月 Science 封面。同一个算法、同一套超参,通吃围棋、国际象棋、将棋三种规则迥异的棋类,都不用开局库和残局表:国际象棋 4 小时超越 Stockfish,将棋 2 小时超越 Elmo,围棋 8 小时超越 AlphaGo Zero。

一、问题:能不能不做”围棋专用系统”#

AlphaGo Zero 还有大量围棋专属设定:利用棋盘的旋转对称性做数据增强、存档式的网络更新、针对围棋设计的搜索细节。AlphaZero 的目标是把这些专用性全部剥掉——一个通用算法,只给它游戏规则,它要能在任何棋类上从零练到世界第一。

二、方法:一个 RL 算法 + 一个 ResNet + MCTS#

  • 算法:与 AlphaGo Zero 同源的强化学习循环,自对弈、用胜负做奖励、周期性自我评估。连训练超参都跨游戏共用。
  • 网络:ResNet(国际象棋、将棋用 20 个残差块 × 256 个滤波器,围棋沿用 40 块)。
  • 输入:纯规则表示,没有人类启发式;国际象棋和将棋不做旋转对称增强(它们没有围棋的对称性)。
  • 搜索:仍是 MCTS,但网络在训练过程中持续更新(不再是”存档式”每局换一次)。

不用开局库、不用残局表——这两样是所有传统棋类引擎的基础设施,AlphaZero 一概不要。

三、算力:5000 块 TPU v1 自对弈 + 64 块 TPU v2 训练#

这是 AlphaZero 工程上最豪横的一笔:5000 块第一代 TPU 并行运行自对弈产生训练数据,64 块第二代 TPU(TPU v2) 负责训练神经网络。推理/对局时则收敛到单机 4 块 TPU

搜索效率的对比更能说明问题:国际象棋中 AlphaZero 每秒只评估约 6 万个位置,而 Stockfish 要评估 6000-7000 万个;将棋里是 4 万对 3500 万。AlphaZero 用深度网络的选择性,换掉了传统引擎的暴力枚举——用一千分之一的搜索量,打出更高的棋力。

四、成绩:几小时速通三大棋类#

游戏超越时刻正式对局结果
国际象棋4 小时超越 Stockfish 8训练 9 小时后 100 局 28 胜 72 平 0 负;12 个流行开局共 1200 局 290 胜 886 平 24 负
将棋2 小时超越 Elmo100 局 90 胜 8 负 2 平
围棋8 小时超越 AlphaGo Zero对局 60<40> 胜出

卡斯帕罗夫看完对局后评价 AlphaZero 的下法”像人类、但更开放,优先棋子活动性而非盘面点数”。Hassabis 称之为”外星人的棋风”——它会主动弃子换取位置优势。值得注意的是,国际象棋那 28 胜 72 平的碾压级战绩,是在 Stockfish 用了 64 线程和大哈希的配置下达成的,赛后 Stockfish 作者 Tord Romstad 还公开批评该配置”不公平地限制了自己”——争议本身就是 AlphaZero 统治力的注脚。

五、意义:从棋盘走向通用 RL 的跳板#

AlphaZero 是第一代”通用强化学习算法”的模板:规则可泛化、超参可迁移、无需领域专家知识。它直接催生了 MuZero(2019,连规则模型都从观察中学)、AlphaTensor(2022,矩阵乘法发现)等后继。对 DeepMind 而言,这套”自对弈 + 强化 + 搜索”的组合,成了与监督学习并行的第二条技术主线——后来大模型时代的 RLHF、自我博弈式数据生成,都能在这篇里找到思想源头。

收尾:我的一点看法#

AlphaZero 是这三篇里”学术味道”最正的一篇:它不再关心围棋本身,而是把围棋、国际象棋、将棋当作同一个问题的三个实例来验证泛化性。这是 DeepMind 从”做最强棋手”转向”做最强方法论”的标志,也是它与 Google Brain 后来在大模型上合并(2023 年成”Google DeepMind”)的思想基础——两边都需要”一套方法打天下”的野心。

当然也要泼点冷水:5000 块 TPU 自对弈的算力门槛,不是普通实验室玩得起的;而且棋类是完美信息博弈,跟真实世界的噪声、不可逆、多人协作完全不同。AlphaZero 证明的是”通用”,不是”万能”。它是一块高质量的跳板,但跳向真实世界的动作,要由 AlphaFold 和后来的大模型来完成。

附:核心数据速查#

算力

  • 自对弈:5000 块 TPU v1;训练:64 块 TPU v2;对局:单机 4 块 TPU
  • 不用开局库、残局表,无领域启发式

三大棋成绩

棋种超越对局
国际象棋4h 超 Stockfish 89h 后 100 局 28 胜 72 平 0 负
将棋2h 超 Elmo100 局 90 胜 8 负 2 平
围棋8h 超 AlphaGo Zero60<40>

搜索效率(每秒评估位置数)

  • AlphaZero:国际象棋约 6 万 / 将棋约 4 万
  • Stockfish:约 6000-7000 万;Elmo:约 3500 万

关键概念清单

  • general reinforcement learning = 通用强化学习(算法跨任务不换)
  • hyperparameter transfer = 超参迁移(一套超参通吃三棋)
  • opening book / endgame tablebase = 开局库 / 残局表(AlphaZero 均不用)
  • MuZero = AlphaZero 后继(连规则都从观察中学习)
  • RLHF = 基于人类反馈的强化学习(本系列思想在大模型时代的延伸)

系列总评#

把三篇论文连起来读,会看到一条清晰的”做减法”路线:AlphaGo 用人类棋谱 + 双网络 + 快走子 + 大规模算力取胜;AlphaGo Zero 删掉人类数据、合并双网络、去掉快走子,用 4 块 TPU 反超;AlphaZero 删掉游戏专用性,让一个算法在三种棋里同时登顶。每一步减法都让系统更通用、更强大,这是 DeepMind 方法论的第一次完整表达:少给先验,多给学习能力

这条线的历史意义远超围棋本身。对深度学习而言,2016 年是”破圈之年”,AlphaGo 让人工智能第一次成为全民议题;对强化学习而言,2017-2018 年确立了”自对弈 + 搜索”这一可复制的范式;对 DeepMind 而言,它验证了团队的核心信念——足够好的学习算法可以在低先验条件下超越专家系统。这个信念后来支撑了 AlphaFold 攻下蛋白质折叠、也渗透进 Gemini 等大模型的训练哲学(RL 对齐、自对弈式数据、推理期搜索)。AlphaGo 系列是 DeepMind 一切后续传奇的源头活水,也是 AI 史上罕见的”三年三台阶”式技术冲刺。

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

AlphaGo:自对弈征服围棋
https://mizuki-eaf.pages.dev/posts/gemini/alphago自对弈征服围棋/
作者
无名之子
发布于
2026-07-29
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录