mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
4284 字
12 分钟
AlphaFold:猜蛋白质变算
2026-08-04

AlphaFold 论文解读:把”猜蛋白质形状”变成”算出来”,顺手拿了诺贝尔奖#

论文:Highly accurate protein structure prediction with AlphaFold(Nature 2021,AlphaFold2) 前作:Improved protein structure prediction using potentials from deep learning(Nature 2020,AlphaFold1) 作者:John Jumper、Richard Evans、Alexander Pritzel、Demis Hassabis 等,Google DeepMind AlphaFold2 是”科学 AI”的封神之作:2020 年 11 月在 CASP14 盲测中以中位 GDT 92.4 的成绩(次佳方法仅 75 左右)解决了困扰学界 50 年的蛋白质折叠问题,2021 年登上 Nature,2024 年让 Hassabis 与 Jumper 摘下诺贝尔化学奖。它是 AlphaGo 方法论从棋盘迁移到真实科学的第一次完整胜利,也是 DeepMind 从”会下棋”到”会做科研”的身份转变。


一、引言:50 年的”蛋白质折叠问题”#

蛋白质由氨基酸链折叠成特定的三维结构,而结构决定功能。从一条一维的氨基酸序列推出三维原子坐标,被称为蛋白质折叠问题,是结构生物学半个世纪以来最硬的骨头。

难在哪里?一个典型蛋白质的可能构象数量高达 10^300 量级(Levinthal 悖论,比可观测宇宙的原子数还多),而实验测定一个结构要花数月到数年、动用上百万美元的设备。安芬森(Anfinsen)早在 1972 年诺贝尔奖演讲里就断言”序列决定结构”,但如何在计算上兑现这个断言,学界努力了 50 年,最好的方法也远达不到原子级精度。

CASP(蛋白质结构预测关键评估)竞赛是这条路上的黄金标准:1994 年由 John Moult 等人创立,每两年一届,用刚测定、未公开的蛋白质结构做盲测,核心指标 GDT(Global Distance Test,全局距离测试,0-100 分,约 90 分被视为与实验结构相当)。到 2018 年之前,自由建模(FM)类目标的最佳中位成绩一直徘徊在 60 分以下,进步缓慢。

更关键的是,CASP 每届都有上百个团队参赛,冠军易主是常态,但所有人都在同一条缓慢的进步曲线上爬行。谁也没想到,2018 年一个”外部玩家”直接把这条曲线掰弯了。

二、前奏:AlphaFold 1 与 CASP13 的震惊首秀#

2018 年 12 月,CASP13 结果公布,首次参赛的 DeepMind 拿下第一——此前 CASP 冠军历来出自学术机构(Baker 实验室、张阳等),企业团队夺冠是头一遭。

这个团队的诞生本身就是一个战略决定:2016 年 AlphaGo 击败李世石之后,Hassabis 拍板把 DeepMind 的方法论押到真实科学问题上,成立了由 John Jumper 领导的蛋白质小组。Jumper 是化学物理博士、Rosetta 软件的深度用户,这个背景让团队既懂深度学习、又懂结构生物学的语言——后来证明,这两门语言的结合正是突破口。

AlphaFold 1(2020 年 1 月 Nature 发表)的方法还带着传统味道:用深度学习预测残基间的距离分布(distogram),据此构建平均力势能(mean-force potential),再用梯度下降优化出三维结构。成绩是:43 个自由建模域中 24 个达到 TM-score ≥ 0.7(次佳方法只有 14 个),自由建模中位 GDT 约 58.9(次两名 52.5、52.4),整体中位 GDT 约 68.5。

值得注意的是,AlphaFold 1 已经让领域震动——它证明了”深度学习读进化信息”这条路走得通,但 58.9 的中位分离”解决”还差得远。CASP14 之前,DeepMind 团队没有急着吃老本,而是推倒重来。

三、核心技术:Evoformer + 结构模块,端到端可微#

从 AlphaGo 到 AlphaFold2,方法论上有一组耐人寻味的对应:AlphaGo 的 MCTS 搜索对应 AlphaFold2 的 recycling 循环精修,策略/价值网络对应 Evoformer 的双表示互更新,AlphaGo 用自对弈生成数据、AlphaFold2 用 MSA 里的进化信号做”免费的自对弈”。共同哲学只有一个:把领域知识转换成数据表示和架构约束,让模型自己长出”直觉”,而不是人手工写规则。

AlphaFold2 与上一代最大的区别是端到端:输入序列和 MSA(多序列比对),直接输出全原子三维坐标,中间没有任何”预测距离图 → 再拼装”的非可微环节。整条管线由三个部件构成。

Evoformer:MSA 与成对表示的双向互更新#

Evoformer 是这一作最重要的架构创新,48 层堆叠,同时维护两种表示:

  • MSA 表示:多序列比对(Multiple Sequence Alignment)——把同源蛋白的序列排成矩阵,用行注意力、列注意力提取进化中的共变信息。哪两个残基”绑在一起变”,往往就意味着它们在空间上靠近。
  • 成对表示(pair representation):残基对之间的特征矩阵,用三角注意力(triangular attention) 和三角更新保证几何一致性——三个残基两两间的距离必须满足三角不等式,这一条直接编码了物理约束。

两种表示在每一层里互相喂信息:MSA 告诉成对表示”这两个位点有进化耦合”,成对表示回报 MSA”这两个残基在空间上挨着”。这种双向互更新,是 AlphaFold2 能够把进化信号和几何约束熔炼在一起的关键。

结构模块:SE(3) 等变的”不变点注意力”#

结构模块把成对表示变成真实的原子坐标,核心是一个叫 IPA(Invariant Point Attention,不变点注意力) 的机制。每个残基被表示成一个带旋转和平移的局部参考系,注意力在这种参考系下计算——SE(3) 等变的意思是:把整个结构平移、旋转任何角度,预测结果跟着一起动,精度不受影响。网络不用再浪费容量去”学习”三维空间的对称性。结构模块8 层权重共享,迭代修正坐标。

端到端可微与 Recycling#

整个网络从序列到坐标全程可微,损失函数直接比较预测坐标与实验结构。输入还会循环 3 次(recycling),让模型反复”重新审视”自己的预测逐步修正。训练时还会用距离图、pLDDT(每个残基的置信度分数)做辅助监督。

四、训练与数据#

训练数据是公开数据的组合拳:PDB(蛋白质数据库,约 17 万个实验结构,截止 2018 年) + Uniclust30 等序列数据库 + BFD 大规模宏基因组数据库。有意思的是,MSA 数据库有几百 GB,是训练管线里最重的部分。

算力门槛比想象中低:约 128 块 TPU v3 核心训练约 1 周(外加数天微调);推理更快——一个 384 残基的蛋白质,单块 V100 GPU 上约 9 秒出结果。相比当时动辄上千卡月的大模型训练,AlphaFold2 算是一股清流,这也解释了它为何能快速落地。

为什么端到端这么重要?上一代的”距离图 + Rosetta 拼装”管线里,每一步的错误都会累积,预测距离图再准,拼装阶段也会把信息糟蹋掉。AlphaFold2 让损失直接作用在最终坐标上,网络被迫学会所有中间表示,等于把错误修正放进了训练本身——这是它敢声称”原子级精度”的底气。

五、评估成绩:CASP14,GDT 92.4#

2020 年 11 月 30 日,CASP14 结果公布,CASP 组织者直接宣布 AlphaFold2 解决了蛋白质折叠问题。核心数字如下:

  • 全部目标中位 GDT 达 92.4,与实验结构相当(GDT 约 90 即视为实验级精度)。
  • 最难的自由建模(FM)类目标中位 GDT 达 87.0
  • 92 个结构域中,87 个达到 GDT > 70(高精度),58 个达到 GDT > 90(实验级)。
  • 按 z 分数汇总排名,AlphaFold2 得 244.0,次佳小组仅 90.8,接近三倍差距。
  • 主链精度中位 0.96 埃(RMSD95),次佳方法 2.8 埃;全原子平均误差约 1.6 埃 ≈ 0.16 纳米——接近一个碳原子的宽度(约 1.4 埃)。

一句话:AlphaFold2 不只赢了一场比赛,而是把整个领域的中位成绩从 60 分直接拉到了 90 分以上。在 2018 年(CASP13)它自己的 58.9 分面前,这是断崖式的跃迁。

CASP14 结果公布当晚,哈佛计算生物学家 Mohammed AlQuraishi 在社交媒体上写道:“这就是范式转移的样子。” 这话不算夸张——上一届 FM 域中位还不到 60 分,AlphaFold2 一次性跳到 87,等于用三年时间把领域五十年的进步曲线拉平之后又续上了一截。

六、落地:2 亿+ 结构数据库与 2024 诺贝尔化学奖#

论文本身也值得一提:2021 年 7 月 15 日发表在 Nature 的这篇论文,随文开放了完整代码与 60 页补充材料,还给出了开源权重——AlphaFold 没有把”黑盒”留给学界。到 2024 年,它已被引用超过 4 万次,是结构生物学领域被引用最多的论文之一。

论文发表后一周,DeepMind 联合 EMBL-EBI 上线 AlphaFold 蛋白质结构数据库,首批开放人类蛋白质组(覆盖约 98.5% 的序列)加 20 种模式生物,共 35 万+ 结构。2022 年 7 月,数据库扩容到 超过 2 亿 个蛋白质结构——近乎所有已编目蛋白质,全部免费开放。

后续时间线把”科学 AI”推上了最高领奖台:

  • 2024 年 5 月:AlphaFold 3 发布,预测范围从蛋白质扩展到 DNA、RNA、配体与离子。
  • 2024 年 10 月 9 日Demis Hassabis 与 John Jumper 因 AlphaFold 获诺贝尔化学奖(与做计算蛋白设计的 David Baker 分享)。
  • 截至 2025 年 11 月,AlphaFold 数据库已被 300 万+ 研究人员、190+ 国家使用,论文被引用超过 4 万次

对一个 DeepMind 内部当年不过二三十人的小组来说,这套落地速度(从 CASP14 到 2 亿结构只用了 20 个月)本身就是一项工程奇迹。

七、局限与后续#

AlphaFold2 不是万能的,论文和后续实践都承认几条边界:一是预测的是单一静态构象,蛋白质在溶液里是动态的,功能往往依赖构象变化;二是对同源序列很少的”孤儿蛋白”、以及膜蛋白等难点类别,置信度会下降(pLDDT 会诚实报低分);三是它预测的是折叠结构,不直接回答动力学问题。AlphaFold 3 引入扩散模型把范围扩大到复合物与配体,AlphaFold 2 本身则在 2021 年后停止迭代,代码开源交给社区。

对结构生物学的冲击也值得记录:实验学家的工作从”测结构”转向”验证结构、研究动态与相互作用”——AlphaFold 数据库让”结构未知”不再成为研究起点,而成了少数难题的标签。当然,这种冲击也带来”预测结果是否被过度信任”的讨论,pLDDT 置信度机制正是对这种疑虑的回应。

还有一个经常被低估的贡献:AlphaFold2 把”结构生物学社区”和”机器学习社区”第一次拉到了同一张桌子上。CASP 从此不再是结构生物学家的独角戏,AI 成为领域基础设施,这为后续 RoseTTAFold、ESMFold 等一批方法快速跟进铺平了路。

收尾:我的一点看法#

AlphaFold2 是我见过最接近”范式革命”的 AI 论文。AlphaGo 赢棋,AlphaFold 赢的是人类理解生命的基础设施。GDT 92.4 这个数字的残酷之处在于:它不是一个渐进改善,而是把领域 50 年的进步曲线直接拉直——2018 年最好的方法 FM 中位不到 60,2020 年 AlphaFold2 做到 87,三年走完了领域五十年的路。

我尤其想夸它的两个设计品味。第一是物理先验的正确姿势:三角注意力把三角不等式编码进网络,SE(3) 等变把旋转对称性写进架构——AlphaFold2 没有把物理扔进垃圾桶,而是用学习系统的语言重新实现了物理。第二是端到端的勇气:上一代的”距离图 + 拼装”管线信息损失严重,Jumper 团队承认”三阶段管线漏掉了大量信息”,干脆全删重来。这种”推倒重来”在工业界大团队里极为罕见。

当然也要清醒:AlphaFold 解决的是”从序列到静态结构”这一环,蛋白质的动态、相互作用、功能涌现仍然困难。但在 Gemini 发展史的背景里看,AlphaFold 是 DeepMind 证明”AlphaGo 方法论不是游戏专用”的决定性证据——它让 Google 管理层确信,DeepMind 的强化学习 + 深度学习组合能够攻下真实科学难题,也为后来 DeepMind 合并 Brain 团队、集中火力做 Gemini 铺设了道义与技术上的双份底气。


附:核心数据速查#

架构配置

组件说明
Evoformer48 层,MSA 表示 + 成对表示双向互更新
三角注意力编码几何一致性(三角不等式)
结构模块8 层权重共享,IPA 不变点注意力,SE(3) 等变
Recycling端到端循环 3 次精修
训练数据PDB(约 17 万结构)+ Uniclust30 + BFD + MGnify
训练算力约 128 块 TPU v3 核心,约 1 周 + 数天微调
推理速度384 残基约 9 秒(单块 V100)

CASP 关键成绩对比

指标CASP13(2018)CASP14(2020)
自由建模中位 GDT约 58.9(AlphaFold 1)87.0(AlphaFold2)
全部目标中位 GDT约 68.592.4
z 分数排名第一244.0 vs 次佳 90.8

AlphaFold2 精度

  • 主链中位精度 0.96 埃(RMSD95),次佳方法 2.8 埃
  • 全原子平均误差约 1.6 埃 ≈ 0.16 纳米(接近原子宽度)
  • 92 域中 87 个 GDT>70、58 个达到实验级(GDT>90)

数据库与荣誉

  • 2021.07:数据库上线,35 万+ 结构(人类蛋白质组约 98.5% + 20 种模式生物)
  • 2022.07:扩至 2 亿+ 结构(近所有已编目蛋白质)
  • 2024.05:AlphaFold 3(扩展至 DNA/RNA/配体)
  • 2024.10:Hassabis、Jumper 获诺贝尔化学奖

关键概念清单

  • protein folding problem = 蛋白质折叠问题(序列 → 三维结构)
  • MSA = Multiple Sequence Alignment,多序列比对(进化共变信号)
  • pair representation = 成对表示(残基对特征矩阵)
  • Evoformer = AlphaFold2 核心模块(双表示互更新)
  • triangular attention = 三角注意力(几何一致性)
  • IPA = Invariant Point Attention,不变点注意力(SE(3) 等变)
  • SE(3) equivariance = 对三维旋转平移等变的性质
  • recycling = 循环精修(端到端多次过网络)
  • GDT = Global Distance Test,全局距离测试(0-100,约 90 视为实验级)
  • RMSD = 均方根偏差(结构叠合误差)
  • pLDDT = 逐残基置信度分数
  • CASP = Critical Assessment of Structure Prediction,盲测竞赛(每两年一届)
  • AFDB = AlphaFold Protein Structure Database,蛋白质结构数据库
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

AlphaFold:猜蛋白质变算
https://mizuki-eaf.pages.dev/posts/gemini/alphafold猜蛋白质变算/
作者
无名之子
发布于
2026-08-04
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录