系列:LLM 与 Transformer 关键论文深度解读(第 3/8 篇) | 其他论文见本目录 01–08 | 合集见工作区根目录《LLM与Transformer关键论文深度解读.md》。
[双向预训练] BERT:深度双向语言理解
论文信息
- 标题:BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- 作者:Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova(Google)
- 发表年份:2019 年 6 月
- 会议/期刊来源:NAACL-HLT 2019(北美计算语言学协会年会,Volume 1),页 4171–4186;获大会最佳论文奖
- arXiv:1810.04805
- 引用量级:10 万次以上(五年内即破 10 万,计算机科学史上被引最高的论文之一)
一、研究背景与核心问题
GPT-1 证明了单向生成式预训练的有效性,但”只能看左边”限制了其表征能力:许多任务(文本蕴含、问答)需要同时利用左右两侧上下文。ELMo 虽做双向,却只是两个独立单向 LSTM 的表征拼接,并非真正的深度双向。论文要解决的核心问题是:如何在预训练阶段实现”深度双向”的上下文表征,且不因双向而泄露目标 token 本身?
直接做法是把语言建模目标改为双向,但那样目标词会”看见自己”,产生循环泄漏(trivially predict the target)。BERT 的解法是掩码语言建模(Masked Language Model, MLM):随机遮住部分词,让模型只凭上下文预测被遮住的词。
二、核心方法与架构创新
- 架构:多层双向 Transformer 编码器(encoder-only)。BERT-Base:12 层、隐层 768、12 头、约 1.1 亿参数;BERT-Large:24 层、隐层 1024、16 头、约 3.4 亿参数。
- 预训练任务一:MLM。随机掩蔽 15% 的 token,模型需还原它们。掩蔽策略(论文第 3.2.1 节):被选中的 token 中,80% 替换为 [MASK] 标记、10% 替换为随机 token、10% 保持不变——后两种做法是为了缓解”预训练时见 [MASK]、微调时不见 [MASK]“的错配,让模型不能依赖标记本身。
- 预训练任务二:NSP(下一句预测)。给定句子 A,判断句子 B 是 A 的真实后续还是随机句子(50%/50%)。此任务旨在让模型学习句子间关系,服务于问答、文本蕴含等任务。
- 微调极其轻量:下游任务只需在 BERT 顶层加一个输出层(分类头/起止位置预测头),全部参数共同微调,无需任务专属架构。
三、关键公式与模块设计原理
3.1 掩码语言建模目标
对掩蔽集 M 中的每个位置 i,最大化还原概率:
其中 x_{\backslash M} 表示掩蔽后剩余的上下文。与 GPT-1 的”预测下一个词”不同,MLM 同时利用左右两侧上下文预测中心词,实现深度双向。
3.2 下一句预测目标
二分类:A 与 B 是否构成连续上下文。
3.3 输入表示
每个输入 token 的嵌入 = 词嵌入(WordPiece,词汇表 3 万)+ 分段嵌入(区分句子 A/B)+ 位置嵌入(可学习的绝对位置)。特殊标记 [CLS] 置于句首,其最终隐状态作为分类任务的聚合表征;[SEP] 分隔句子。
四、实验设置与主要结果
- 预训练数据:BooksCorpus(8 亿词)+ 英文维基百科(25 亿词),共约 33 亿词。
- 任务与结果(11 个任务全面 SOTA,论文摘要数据):
- GLUE 综合分:80.5,绝对提升 7.7 分;
- MultiNLI 准确率:86.7%,绝对提升 4.6%;
- SQuAD v1.1 问答 F1:93.2(+1.5);
- SQuAD v2.0 F1:83.1(+5.1,此前模型几乎无法处理无答案问题)。
- 消融结论:移除双向性(退化为类 GPT 单向)使所有任务显著下降;NSP 对 NLI 类任务有明显帮助;相比 ELMo/GPT 的特征式或微调式使用,BERT 的全参数微调最优。
五、局限性与后续影响
局限性:
- MLM 的”掩蔽-还原”与真实生成/理解场景存在错配(微调时无 [MASK]);
- 后续研究(RoBERTa)发现 NSP 贡献有限甚至有害,删除后可进一步提升;
- 预训练与微调开销大,长序列受限于 O(n²) 注意力;
- 只建模理解(encode),不适配生成式任务。
后续影响:BERT 家族(RoBERTa、XLNet、ALBERT、DistilBERT、ELECTRA)开创了”预训练-微调”黄金时代;被 Google 搜索等工业系统大规模采用;与 GPT 路线共同证明 Transformer + 海量无监督预训练是通向通用语言智能的主路。其对”双向上下文”的强调也反向刺激了生成式模型的发展。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





