
序列到序列模型两个 RNN 假装是翻译器。它们遇到的瓶颈正是注意力机制存在的原因。类型:构建语言:Python前置条件:Phase 5 · 08(CNN + RNN 处理文本),Phase 3 · 11(PyTorch 简介)预计用时:~75 分钟问题分类将可变长度序列映射到单个标签。翻译将可变长度序列映射到另一个可变长度序列。输入和输出存在于不同的词汇表中,可能是不同的语言,不保证长度对等。seq2seq 架构(Sutskever, Vinyals, Le, 2014)用一个简洁的方案破解了这个问题。两个 RNN。一个读取源句子并生成固定大小的上下文向量。另一个读取该向量并逐词元生成目标句子。就是你在第 08 课写的代码,用不同的方式拼接在一起。这值得研究有两个原因。首先,上下文向量瓶颈是 NLP 中教学价值最高的失败。它驱动了注意力机制和 Transformer 擅长的一切。其次,训练方案(教师强制、计划采样、推理时的束搜索)仍然适用于包括 LLM 在内的每个现代生成系统。核心概念编码器。一个读取源句子的 RNN。其最终隐藏状态是上下文向量——整个输入的固定大小摘要。理论上除了源序列什么都没丢。