mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1527 字
4 分钟
05_[统一框架]_T5_统一文本到文本
2026-07-26

系列:LLM 与 Transformer 关键论文深度解读(第 5/8 篇) | 其他论文见本目录 01–08 | 合集见工作区根目录《LLM与Transformer关键论文深度解读.md》。

[统一框架] T5:统一文本到文本#

论文信息#

  • 标题:Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
  • 作者:Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu(Google;前四位并列第一作者)
  • 发表年份:2020 年(2019 年 10 月首发 arXiv)
  • 会议/期刊来源:Journal of Machine Learning Research(JMLR)21(140): 1–67,2020
  • arXiv:1910.10683
  • 引用量级:数万次(迁移学习领域被引最高的方法论论文之一)

一、研究背景与核心问题#

2018–2019 年预训练方法爆发式涌现(GPT、ELMo、BERT、XLNet、RoBERTa、ALBERT、Reformer……),但彼此在预训练目标、架构、数据、训练策略上各不相同,结果难以横比。学界无法回答一个基本问题:到底哪些设计决策真正起作用? 论文的定位是”迁移学习方法的系统性实证调查”,并提出一个统一的实验框架,把所有文本问题放进同一种形式里逐一对比。

二、核心方法与架构创新#

  1. 统一 text-to-text 框架:把一切 NLP 任务(分类、翻译、摘要、问答,甚至回归)都表示成”文本输入 → 文本输出”,用同样的模型、同样的损失(输出 token 的交叉熵)、同样的超参数处理所有任务。任务差异只体现在输入前缀(如 “translate English to German: …”、 “summarize: …”)。
  2. 新预训练语料 C4:Colossal Clean Crawled Corpus——对 Common Crawl 进行启发式清洗(去重、去脏文本、滤掉非英文/不完整句子)后得到约 750GB 高质量文本,比维基百科大两个数量级,解决了”既有语料要么规模小、要么质量差”的矛盾。
  3. 系统性方法论研究:在统一框架内对比——架构(编码器-解码器 vs 仅解码器 vs 仅编码器)、预训练目标(含去噪式”跨度破坏”)、无标注数据选择、训练策略(多任务学习)、规模扩展方式(模型大小 / 训练时长 / 集成数量)。
  4. 模型族:从 6000 万到 110 亿参数共五种规模;全部开源(Apache 2.0),含代码与数据。

三、关键公式与模块设计原理#

3.1 text-to-text 训练目标#

对任意任务,输入文本序列 x、目标序列 y,优化输出序列的负对数似然:

L=logPθ(yx)=tlogPθ(ytx,y<t)\mathcal{L} = - \log P_\theta(y \mid x) = -\sum_{t} \log P_\theta(y_t \mid x, y_{<t})

与 GPT 的因果语言建模不同,这里的解码器按需生成目标文本,编码器可双向读取输入——是”理解 + 生成”的统一。

3.2 跨度破坏(Span Corruption)预训练目标#

论文在多种去噪目标中优选了”跨度破坏”:从输入文本中随机采样长度不等的连续跨度(span),用哨兵 token(如 <X><Y>)替换,模型的任务是输出”哨兵 + 原始跨度”的序列以还原原文。例如:

输入: Thank you <X> me to your party <Y> week.
目标: <X> for inviting <Y> last <Z>

相比逐词掩码,跨度破坏以”片段”为单位建模,更接近真实文本的局部依赖结构,且实验显示其在固定计算预算下效果最佳。

3.3 关键消融结论(方法论价值所在)#

  • 架构:编码器-解码器整体优于仅解码器与仅编码器(仅编码器无生成能力、仅解码器对理解任务略逊);
  • 目标:去噪类(fill-in-the-blank)目标优于纯语言建模;最重要的影响因素是计算成本(等预算下再比效果);
  • 数据:领域内数据有益,但小语料预训练会导致过拟合(下游任务反而变差);
  • 多任务学习:接近”预训练-微调”,但需精细控制各任务采样频率。

四、实验设置与主要结果#

  • 基准:GLUE、SuperGLUE、SQuAD、CNN/DailyMail 摘要、WMT 翻译等。
  • 主要结果(结合全部最佳实践 + 规模扩展):
    • SuperGLUE:88.9,接近人类基线 89.8——论文明确指出这是”接近人类水平”的突破;
    • GLUE、SQuAD、CNN/DailyMail 均达当时 SOTA;
    • T5-11B 通过”闭卷问答”(closed-book QA)展示了从参数中直接检索知识的能力,无需外部检索器。
  • 对比意义:论文不是”某单点超越”,而是首次给出可复现的、控制变量的方法论排序,使后续研究者知道”把钱花在哪儿”。

五、局限性与后续影响#

局限性

  • 以英文为中心,跨语言能力有限(后续 mT5 扩展);
  • 编码器-解码器在解码时计算开销高于纯解码器,规模扩展效率不如单栈;
  • 系统研究在固定算力预算下进行,结论对超大规模训练未必完全适用;
  • 未系统讨论训练能耗与环境成本。

后续影响

  • T5 的”统一任务表述”直接启发 instruction tuning(FLAN、T0 把指令式多任务微调发扬光大,成为现代”指令对齐”的前身);
  • C4 成为开源社区事实标准预训练语料之一;
  • mT5、Flan-T5、CodeT5 等衍生模型广泛用于工业界;T5 的 span corruption 与 text-to-text 思想至今影响多模态生成模型的设计。

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

05_[统一框架]_T5_统一文本到文本
https://mizuki-eaf.pages.dev/posts/llm-papers/05_统一框架_t5_统一文本到文本/
作者
无名之子
发布于
2026-07-26
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录