——知识体系收官:从 RNN 到 Transformer 的完整地图)
路标本篇位于《从零构建 Transformer》系列第 16/16 章 · 实战篇收官。系列主线注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。进度▸ 基石篇(1-5) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸实战篇(14-16·本篇)▸知识收官摘要第 16 章是系列收官把 16 章织成一张从 RNN 到 Transformer 的完整地图。用知识体检脚本一次性重跑全系列关键验证softmax 行和、因果掩码、BPE 合并、标签平滑有界、CLS 聚合、温度性质、迁移学习等9 项全部通过手写复杂度对比注意力二次方 vs RNN 线性与长依赖演示1 步直达 vs 7 步传递最后给出双体系认知树、16 章知识树与四阶段学习路线。上一篇四十四微调预训练 BERT 做下游任务引言最后一章把 16 章织成一张地图第 1 章我们从一个问题出发“RNN 为什么记不住长句子”16 章之后你手里已经有一整套答案——注意力机制、多头、位置编码、Encoder/Decoder、完整前向、训练三件套、BPE 分词、BERT、GPT、从零训练、迁移微调。但会了 16 章不等于懂了一个体系散落的 16 块拼图需要最后一块把它们拼成一张完整的地图。这一章不学新知识做四件事摊开地图16 章四个阶段基石/架构/预训练/实战的关系一张图看全图 1对比双雄RNN 家族 vs Transformer 家族——记忆机制、复杂度、长依赖、适用场景七维对照图 2、3、4、7知识体检用一段脚本把前 15 章的核心验证一次性重跑9 项全部 ✅——证明这个系列每一章的数字今天还能原样重现demo2织成认知树16 章知识树 学习路线 应用全景告诉你学完之后你的位置在哪、下一步去哪demo4、图 5、8、9。这也是本系列最后一次贯彻它的方法论不背结论用数字说话。收官章的数字就是把前 15 章的关键结论再验一遍——用真实输出证明你学到的不是一个一个孤立的技巧而是一张自洽的、可复现的知识地图。如果说前 15 章是分别在每一块拼图上画细节这一章就是把拼图按正确的位置摆好退后三步看全貌。你会发现一个之前可能没注意到的规律每块拼图之间的关系比拼图本身更重要——比如第 8 章的掩码在第 13 章的 GPT 里是因果世界观第 12 章的[CLS]“在第 14 章的分类器里是句子表示”第 10 章的小学习率在第 15 章的微调里是保护先验。同一个机制在不同场景反复出现——这是体系感的真正来源也是本章要帮你建立的东西。本章目标把 16 章四个阶段的递进关系看成一整条主线图 1建立RNN 家族 vs Transformer 家族的双体系认知树图 2用实验说清两者最本质的差异——记忆机制demo3、图 3用真实计算量对比复杂度 O(S) vs O(S²)demo1、图 4一键重跑前 15 章关键验证9 项全部通过demo2、图 6收下 16 章知识树与四阶段学习路线demo4、图 5、图 8看清你学的三大模板 当今 AI 全景图 9并为系列画上句号图 10。一、先把 16 章摊开四阶段一条主线四阶段不是随意切的而是从理解到建造的四个台阶基石篇1-5回答注意力为什么存在、怎么算。从 RNN 的痛点出发第 1 章到自注意力 QKV第 2 章、缩放点积第 3 章、多头第 4 章、位置编码第 5 章——这一阶段结束时你看懂了注意力的每一个公式架构篇6-10回答零件怎么组装成机器。整体架构第 6 章、Encoder 内部第 7 章、Decoder 内部第 8 章、完整前向第 9 章、训练三件套第 10 章——这一阶段结束时你造得出一台能跑能训的 Transformer预训练篇11-13回答大模型是怎么来的。BPE 分词第 11 章、BERT 双向第 12 章、GPT 自回归第 13 章——这一阶段结束时你认得当今两大模板实战篇14-16回答模型怎么干活。从零训练分类器第 14 章、微调预训练 BERT第 15 章、收官本篇——这一阶段结束时你跑得通真实任务。看懂 → 造出来 → 认识大模型 → 亲手跑任务——这就是本系列 16 章的全部结构。你现在站在这条主线的终点回头看每一章都是前文的下文、后文的伏笔。1.1 每个阶段的毕业考。四阶段各有一个毕业考考过了才算真正进入下一阶段基石篇的毕业考是能不能用一句话说清 QKV 和缩放点积第 2、3 章的公式架构篇的毕业考是能不能让第 9 章的机器跑通前向并通过五道体检预训练篇的毕业考是能不能说清 BERT 与 GPT 的架构差异从哪来第 13 章的图 10实战篇的毕业考是能不能独立跑通从数据到预测的完整闭环第 14 章的五步。本章收官的毕业考就是 demo2 的知识体检——9 项验证全绿才算正式毕业。把这张毕业考地图记下来它就是你以后复习本系列时的索引哪一题不会回到对应阶段补课。二、两个家族RNN vs Transformer 认知树这一章最该带走的认知升级是你学过的所有模型都长在同一棵树上。树根是序列建模处理一串有序的东西两大枝分道扬镳的方式只有一处——记忆用什么实现RNN 家族用隐状态记住历史。每一步把新输入 旧隐状态揉成新隐状态信息靠接力传递Transformer 家族用注意力记住历史。每个位置直接看所有相关位置信息靠直达获取。这一处差异衍生出后面所有的不同复杂度、长依赖、并行、可扩展性。抓住记忆机制这个根其余全是推论——这是本章最重要的思维方法。2.1 认知树的实用价值三秒选型。画这棵双体系树不只是好看它直接服务于工程选型遇到一个序列任务先问序列长不长、数据多不多、要并行吗——短序列 小数据 低算力 → RNN 够用且省第 14 章思考题长序列 大数据 要规模 → Transformer“两个家族不是敌人是两种复杂度预算下的最优解”。这棵树还帮你读论文任何新模型先在树上找到它的枝属于哪个家族、哪个模板再去看它改了什么——有了树的坐标系论文从天书变成增量更新。2.2 为什么注意力能当记忆用一个可能让你困惑的点注意力不是存储它凭什么记住答案是Transformer 不存储历史它重放历史。RNN 把历史压缩进隐状态类似记笔记注意力则把历史原样摆在打分矩阵里、随时按需取用类似留原文需要时翻。具体说位置 S 的表示 对所有历史位置的加权求和第 3 章公式权重由相关性决定——记住什么不是写死的而是每次前向时动态决定的。这带来两个特性①容量不限——历史不压缩多少都能翻只是 O(S²) 的代价②相关性驱动——不是机械地记住前一个而是记住相关的可能隔很远。“动态重放取代静态压缩”这就是注意力和隐状态最深刻的区别。三、本质差异记忆机制“接力” vs “直达”把两个家族最本质的差异用实验讲透demo3【demo3】长依赖第 1 个词如何影响最后 1 个词 位置 0 的信息传到位置 7 RNN要串行传递 7 步每步只挪一格长依赖长链条 注意力1 步直达打分矩阵里位置 0 与位置 7 直接相乘 解码器因果场景注意力也只能看左边但左边全部都直达不需要逐格传递 → 这就是为什么 Transformer 能建模长依赖、而 RNN 长序列会梯度消失/信息稀释为什么接力会出问题两层原因①信息稀释——每一跳都经过遗忘门式的压缩7 跳之后第 1 个词只剩一点点痕迹②梯度消失——反向传播时梯度要沿着同样长的链条传回去连乘 1 就会指数衰减第 1 章 RNN 篇详述。而注意力的直达同时绕开这两层信息不用压缩直接看原始位置、梯度不用爬链一跳就到。这就是 Transformer 能统治长序列建模的根本原因。3.1 顺带回顾RNN 家族的三代补课。RNN 系列里我们讲过RNN 家族也在对抗接力的缺陷RNN → LSTM → GRU就是三代补课史——RNN 的隐状态会被快速遗忘LSTM 加记忆细胞 遗忘门专门留一条直达通道让信息少衰减GRU 合并门控、更精简。但它们的共同前提没变信息还是要逐格传递第 t 步必须经过第 t-1 步。Transformer 的注意力直达直接取消了这个前提——不是优化接力而是取消接力。这个对比值得记住LSTM 在接力赛里把每一棒的掉棒率降到最低注意力则干脆把赛道改成了所有人手拉手——所以它才能一步到位。3.2 一个记一辈子的比喻。如果只允许用一个比喻描述两者的记忆差异RNN 像传话游戏第一个人说的话要经过十个人转述最后往往面目全非Transformer 像会议室开会每个人发言时其他人直接看向发言人想听谁的、听多清楚自己说了算。传话游戏越多人越失真长依赖稀释开会则无论多少人都能听清任何一句注意力直达。下次有人问你为什么 Transformer 比 RNN 强先说这个比喻再补上 7 步 vs 1 步的数字——形象 精确一次讲透。四、代价与优势复杂度 O(S) vs O(S²)看得全是有代价的——注意力是 O(S²)每个位置要看所有位置RNN 是 O(S)。用真实数字感受这个差距demo1【demo1】复杂度对比序列越长差距越大真实计算量 序列长S 注意力O(S²) RNN O(S) 倍数 8 64 96 1× 16 256 192 1× 32 1024 384 3× 64 4096 768 5× 128 16384 1536 11× 256 65536 3072 21× 512 262144 6144 43× 1024 1048576 12288 85× S1024 时注意力计算量是 RNN 的 85 倍——但注意力的优势是并行 任意距离直达这张剪刀差图值得多看两秒——它浓缩了 Transformer 的整个处境RNN 便宜但短视注意力昂贵但看得全。为什么现实选择了后者两个平衡点①并行O(S²) 的矩阵乘法可以整块扔给 GPU第 9 章手撕过一次 matmul 算完所有位置的打分而 RNN 的 O(S) 是串行的第 t 步依赖第 t-1 步无法并行——GPU 时代“算得贵但能并行” 胜过 “算得便宜但只能串行”②序列长度现实任务句子、段落、文档的 S 通常几十到几百S² 在这个量级可承受真正的超长序列几万 token才需要稀疏注意力/滑动窗口等改进。复杂度是约束但架构的取舍从来不是单看复杂度。4.1 复杂度之外参数量与数据的对比。除了计算复杂度两个家族还有两组账值得对比①参数量——RNN 的隐状态权重与序列长度无关参数固定Transformer 的注意力/FFN 参数也与长度无关第 9 章形状保持——两者的参数规模其实同量级②数据需求——RNN 靠顺序归纳偏置相邻信息天然关联在小数据上也能学Transformer 靠注意力自己发现关联需要更多数据喂出这些关联第 14 章讨论过短文本小数据下两者差距小。所以Transformer 需要更多数据不是缺陷而是它把先验从架构里拿出来、交给数据去学的代价——这也解释了为什么预训练海量数据对 Transformer 尤其重要第 15 章的迁移学习就是拿预训练数据补齐这个缺口。4.2 超长序列怎么办改进方向速览。O(S²) 的约束催生了一串改进家族看到名字能对上号即可①稀疏注意力每个位置只看附近 少数全局位置复杂度降到 O(S) 量级②线性注意力用核技巧把注意力写成先右乘再左乘O(S)③滑动窗口只让相邻窗口内互相注意Longformer④KV 缓存生成时缓存历史 K/V避免重复计算第 13 章 3.2 提过。这些改进都在牺牲一点看得全、换来算得快但它们的底座仍然是本章图 4 那条 O(S²) 曲线——看懂基准才能看懂改进。五、全系列知识体检前 15 章的核心验证一次重跑这是收官章最有仪式感的一步把前 15 章的关键结论全部用代码再验一遍demo2——就像毕业答辩把四年的实验数据当众复现【demo2】全系列知识体检前 15 章的核心验证一次重跑 验证项 结果 第3章 注意力权重行和1 ✅ 通过 第4/9章 多头切分后 (B,h,S,dk) 形状 ✅ 通过 第8/13章 因果掩码未来位置权重0 ✅ 通过 第10章 平滑CE在 a*4.691 处梯度≈0 ✅ 通过 第11章 BPE 第1轮合并 er→er ✅ 通过 第12章 [CLS] 行和1聚合全句 ✅ 通过 第13章 T0.5 最大概率 T2.0温度越低越尖锐 ✅ 通过 第14章 分类头输出 (B,2) 且行和1 ✅ 通过 第15章 微调 88.3% 从零 76.7%迁移学习生效 ✅ 通过 全部 9 项验证通过✅ YES这 9 项不是随机挑的——它们对应着系列里最重要的 9 个数学/机制结论softmax 的性质第 3 章、多头切分的形状第 4 章、掩码的机制第 8 章、标签平滑的有界性第 10 章、BPE 的合并第 11 章、CLS 的聚合第 12 章、温度的单调性第 13 章、分类头的正确性第 14 章、迁移学习的有效性第 15 章。每一章你信过的结论今天都原样重现——这就是实操验证的价值不是作者说了算是数字说了算。5.1 体检的挑选标准为什么是这 9 项收官的体检不能把 15 章每个 demo 都跑一遍太长所以挑一杆子插到底的代表①覆盖全部阶段——基石篇第 3、4 章、架构篇第 8、10 章、预训练篇第 11、12、13 章、实战篇第 14、15 章各章都有代表②都是一句话能说清的性质——行和1、形状不变、权重0、梯度≈0这些性质最容易写错、也最容易验证是手撕代码时的金标准③都能在毫秒级验证——不依赖训练、不依赖大模型纯 NumPy 一行重跑。这套挑选标准本身也是一种方法论复习任何知识体系都可以抽出核心性质做体检——快、准、可复现。5.2 从体检到工程实践。这套性质体检不只是收官仪式它在工程里天天用改代码后的第一件事就是重跑性质检查——改完多头注意力检查输出形状改完 softmax检查行和改完掩码检查被遮位置权重。把性质断言写进代码assert就是最便宜的单元测试——本系列每个 demo 里那些行和1、权重0的验证本质就是测试用例。如果你在自己的项目里也养成每个核心函数带一条性质断言的习惯你会少踩 90% 的静默错误第 9 章强调过形状错不报错、方向错不报错性质断言是照妖镜。5.3 体检之外那些验不出来的知识。也诚实说一句知识体检只能验证可计算的性质而系列里还有一类知识无法用断言验证、只能靠体会——比如为什么大学习率会发散第 10 章 demo6 的轨迹、“为什么微调要先验保护”第 15 章、“为什么温度影响风格”第 13 章。这些是手感型知识体检测不了但你亲手跑过、见过曲线和数字手感已经在。所以收官体检的真正含义是可验证的结论全部复核可体会的手感你已经拥有——两者加起来才是完整的学会。六、16 章知识树你的知识坐标体检通过后把 16 章织成知识树demo4 真实输出看这棵树的方式自下而上读——第 1 章的注意力为什么存在是所有枝干的根往上是第 2-5 章怎么算注意力再往上是第 6-10 章怎么组装第 11-13 章是大模型这一层第 14-15 章是怎么用。你现在的知识坐标在树冠第 16 章但你亲手爬过每一根枝干——这不是看了一遍地图而是走过一遍地图。6.1 用知识树做查漏补缺。知识树不只是回顾更是诊断工具对照图 5如果某根枝干的关键词你无法用一句话解释清楚那就是该回去补的章节。比如残差连接为什么重要答不上 → 回第 7 章为什么 BERT 用 [CLS] 不用平均池化答不上 → 回第 12 章为什么微调学习率要小答不上 → 回第 15 章。给每个关键词配一句为什么是检验掌握度的最公平标准——比背定义严格得多因为为什么必须建立在理解上。做一遍这个自测你会精确知道自己的薄弱点在哪一章。6.2 知识树的两遍读法。这棵树值得读两遍第一遍从上往下——先看四阶段主干图 1知道体系长什么样第二遍从下往上——从第 1 章开始沿枝干上行回忆每章的核心概念 关键数字 一个 demo 结论。第二遍是检验走不下去的地方想不起某章在讲什么就是该翻回去的地方。两遍都走通这棵树才算真正长在你脑子里——不是看过地图而是把地图走了两遍。七、RNN vs Transformer七维综合对比把两个家族放在一张表里回答第 14 章留下的思考题七行里藏着三句总结①先进不等于任何场景都更好——数据少、句子短RNN 够用且省第 14 章思考题答案②Transformer 赢在并行 长依赖 可扩展——这三条正好是深度学习时代的刚需③今天的大模型几乎全部是 Transformer——不是因为它便宜而是因为它在规模放大这件事上没有天花板GPT-1 到 GPT-3 就是证明第 13 章。7.1 三个数字锚点。把七维对比浓缩成三个数字锚点记忆负担最小、复述最有力①O(S) vs O(S²)复杂度之差第 4 节实测 85 倍②7 步 vs 1 步长依赖之差demo3 的传递步数③76.7% vs 88.3%实战之差第 15 章微调 vs 从零。面试或聊天时抛出这三个数字再展开解释为什么——三个锚点 一句机制就是最省力的表达结构。7.2 面试版30 秒说清 RNN vs Transformer。把七维对比压缩成一段面试答案背下来就能用“RNN 用隐状态顺序传递信息复杂度 O(S) 但无法并行、长依赖会梯度消失Transformer 用注意力让每个位置直达所有相关位置复杂度 O(S²) 但可并行、擅长长依赖。所以 RNN 适合短序列、低算力场景Transformer 是大规模序列建模的标准也奠定了 BERT、GPT 等预训练模型的基础。”——三句话覆盖了机制、代价、适用、影响四个维度面试官再追问任何一个细节复杂度多少、为什么梯度消失、注意力怎么并行都在本系列的对应章节里有答案。会压缩是理解的高级形式能把 16 章压缩成 3 句话说明体系真的建起来了。八、学习路线四阶段方法论这一张图其实是给打算带别人入门的你准备的——如果朋友问你怎么学 Transformer就把这张图给他先看懂注意力别一上来啃大模型论文再亲手造一台小机器别只看不写再认识 BERT/GPT此时论文不再可怕最后跑真实任务让知识落地。本系列 16 章就是这个路线的完整注脚。8.1 本系列与 RNN 系列的关系。如果读者是从 RNN 系列过来的系列开篇说过继《从零构建 RNN》系列之后这里补一句衔接两个系列合起来才是深度学习序列建模的完整地图——RNN 系列讲了接力派RNN/LSTM/GRU 的原理、手撕、实战包括 IMDB 79.8%本系列讲了直达派注意力/Transformer/BERT/GPT。第 16 章的图 2 把两棵知识树并排放在一起——你现在手里有两套序列建模的完整实现遇到任务可以根据序列长短、数据多少、算力高低来选型图 7 的七维对比就是选型手册。双体系在手才叫真正的会选型。九、应用全景三大模板 当今 AI最后一个认知升级你学的三大模板恰好覆盖了当今 AI 全景。把图 9 记在脑子里以后再看到任何新模型问自己三句话①它是 Encoder、Decoder 还是 Enc-Dec②它的记忆是注意力吗③它加了什么新头/新任务——这三问能让你在 30 秒内定位任何一个 Transformer 家族成员包括你没见过的新模型。这就是看懂了母语的意思不是背下每个单词而是能拆解任何句子。9.1 三个模板的边界为什么有些任务两者皆可。一个进阶问题分类任务既可以用 EncoderBERT 系也能用 DecoderGPT 系为什么答案在任务的定义方式同样的情感分类可以定义成看完句子直接判断Encoder第 12 章 [CLS]也可以定义成让模型生成’积极’或’消极’这个词Decoder第 13 章生成——任务可以被翻译成不同模板的输入输出格式。这就是为什么 GPT 也能做分类给它一句这句话是积极还是消极只是效率上 Encoder 更直接。模板决定能力边界能不能生成、能不能看右边不决定能做什么任务——任务可以被格式适配。理解这一层你对为什么有那么多模型的困惑就基本解开了模型是能力的仓库任务是格式的调用。9.2 一个母语练习。收下三问定位法后做一个小练习巩固随便想一个你最近听过的 AI 产品AI 写作助手、代码补全、智能客服、AI 搜索……用三问定位它①用的什么模板几乎都是 Decoder 生成②输入输出是什么格式文本生成/对话/检索生成③在三大模板上加了什么RAG 检索、工具调用、多模态编码器。你会发现所有产品都能拆回第 12、13 章的两台机器 一层外壳——这就是看懂了母语的验证能拆解任何句子产品。十、收官与反思系列完结但你的路才刚开始最后作为系列收官三条过来人反思最大的弯路是只看不写注意力公式读十遍不如手撕一遍第 3 章如果你跟着每章跑过验证脚本你现在的手感已经超过大多数读过 Transformer的人最大的误区是背结论这一章的知识体检证明每个结论都能用代码重现——能重现的结论才是你的背下来的不是最大的收获是方法论原理 → 手撕 → 实战这条线让 16 章没有一章是听过就算。这套方法论可以迁移到任何新方向扩散模型、多模态、强化学习——你学会的不是 Transformer而是怎么学会一个技术体系。10.1 全系列关键数字总表。收官前把 16 章里最重要的数字汇总成一张表——它们既是复习索引也是面试弹药库章节关键数字意义第3章QKᵀ/√dk√dk 缩放防 softmax 饱和第5章PEsin/cos(pos/10000^{2i/d})位置信息注入第9章形状 (B,S,d) 一路不变可无限堆叠第10章平滑最优 a*ln(109)≈4.69AdamW 衰减 0.5×0.99ᵗ有界 logits解耦衰减第11章词表 初始字符 合并次数BPE 直线规律第12章CLS 权重 [0.27,0.22,0.20,0.16,0.15]小 BERT 25 步 loss 2.43→0.65聚合全句训练机制第13章T0.5→0.862 / T2.0→0.442生成 a b c d…温度性质自回归第14章92.5% vs 基线 50%从零训练闭环第15章微调 88.3% vs 从零 76.7%迁移学习价值第16章复杂度 85×S10249 项体检全 ✅代价与体系这十行数字是你复习本系列的最快路径——看到数字想起机制想起机制想起章节一套完整的知识索引就建立了。10.2 下一步的四个方向。系列完结不等于学习结束给你四条接棒路线按兴趣选①工程方向——去 HuggingFace 用transformers复现第 15 章微调把bert-base-chinese换到真实 IMDB 上看准确率能否到 90%②原理方向——读 Transformer 论文原文Attention Is All You Need对照本系列逐段验证——你会发现论文每个公式你都手撕过③扩展方向——从本章 4.2 的改进家族入手稀疏注意力、线性注意力理解在 O(S²) 基准上的优化④大模型方向——从 GPT-3 的 in-context learning 开始第 13 章 6.1 提过探索 RLHF、Agent、多模态——这些新概念的底座都在本系列的三大模板里。四条路随便选都不会迷路。常见坑与自查收官版把 16 章当 16 个孤立技巧错。它们是同一棵树的枝干图 2、图 5——记忆机制这个根串起了全部差异以为 Transformer 全面碾压 RNN第 14 章思考题的答案短序列、小数据、低算力下 RNN 够用且省图 7。“先进是更适应大规模”不是处处更好把 O(S²) 当致命伤S² 在常见序列长度几十到几百可承受且能并行GPU 矩阵乘法——复杂度要看实际量级 能否并行两个维度demo1以为会了前 15 章 “懂体系”收官章的意义就是把散点连成网——如果你还说不清为什么 Transformer 能建模长依赖回去看第 3 节毕业即停滞系列的终点是你能独立学习任何新模型的起点图 9 的三问定位法下一步建议去 HuggingFace 把bert-base-chinese和gpt2各加载一次用第 11 章的 tokenizer 和本章的知识树解剖它们把复杂度当非黑即白O(S²) 不是不可用的判决——S1024 时 85 倍差距听起来吓人但 GPU 并行 实际序列长度几百让它完全可承受复杂度要结合量级 并行性一起看demo1只记数字不记为什么数字表10.1 节是索引不是终点——92.5%要能讲出842 参数 60 步 10% 噪声的故事4.69要能推出 ln(109)。数字是结论机制是灵魂。小结系列收官核心收获七条四阶段主线看懂1-5→ 造出来6-10→ 认识大模型11-13→ 亲手跑任务14-16图 1双体系认知树序列建模的根RNN隐状态记忆与 Transformer注意力记忆两大枝图 2记忆机制是总根源接力7 步稀释vs 直达1 步到位——长依赖、梯度消失、并行性全部由此推论demo3、图 3复杂度是代价O(S) vs O(S²)S1024 时相差 85 倍但并行 看得全让 Transformer 在大规模下胜出demo1、图 4知识体检全绿前 15 章 9 项核心验证一次重跑全部 ✅——系列每一章的结论都经得起重现demo2、图 6知识树与路线16 章树状结构 四阶段学习路线你的知识坐标在树冠、路径在脚下demo4、图 5、图 8三大模板 当今 AIEncoder懂/Decoder写/Enc-Dec转换覆盖 BERT/GPT/T5 及所有后代图 9系列收官图 10体系感 关系 拼图同一个机制掩码/CLS/小学习率在不同场景反复出现——抓住记忆机制这个根全部差异都是推论数字总表10 行关键数字4.69、0.99ᵗ、85×、92.5%、88.3%…就是你的复习索引与面试弹药库10.1 节。从第 1 章的RNN 为什么记不住长句子到第 16 章的知识地图全绿——16 章、45 篇博客、几十个 demo、上百个真实输出你走完了从零构建 Transformer的全程。感谢你读到这一行。下一站是真实世界的 BERT、GPT、Llama——你会发现它们都是你亲手造过的那台小机器的放大版。也请记住本系列最后一句话原理从来不是背出来的是跑出来的你跑过的每一个 demo都是你未来在真实项目里最可靠的底牌。《从零构建 Transformer》系列 · 完结