ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

大语言模型技术 step by step 第1章 大模型概述

大语言模型技术 step by step 第1章 大模型概述 第1章 大模型概述学习目标理解什么是语言模型以及大模型中大的含义了解从统计语言模型到神经语言模型再到大语言模型的发展脉络掌握大模型的核心能力涌现能力、上下文学习、思维链推理、推理模型与测试时计算建立对本系列文章后续内容的整体认知框架1.1 什么是语言模型1.1.1 语言模型的概率定义语言模型Language Model, LM是对自然语言序列概率分布进行建模的系统。给定一个由词组成的序列w1,w2,…,wTw_1, w_2, \dots, w_Tw1​,w2​,…,wT​语言模型刻画的是这个序列作为一个合法自然语言出现的概率P(w1,w2,…,wT)P(w_1, w_2, \dots, w_T)P(w1​,w2​,…,wT​)直接对联合概率建模是困难的因为序列的可能组合数随长度呈指数增长。利用概率论的链式法则联合概率可以分解为一系列条件概率的乘积P(w1,w2,…,wT)∏t1TP(wt∣w1,w2,…,wt−1)P(w_1, w_2, \dots, w_T) \prod_{t1}^{T} P(w_t \mid w_1, w_2, \dots, w_{t-1})P(w1​,w2​,…,wT​)t1∏T​P(wt​∣w1​,w2​,…,wt−1​)这个分解具有深刻的含义一个语言模型的核心任务就是在给定上文的情况下预测下一个词的概率P(wt∣wt)P(w_t \mid w_{t})P(wt​∣wt​)。这种看着上文、预测下文的建模方式被称为自回归语言模型Autoregressive Language Model。GPT 系列以及今天绝大多数大语言模型都采用这一范式。1.1.2 预测下一个词意味着什么初学者常常困惑仅仅是预测下一个词为什么能产生如此强大的能力这个问题的答案涉及几个层面第一预测要求理解。要准确预测 “太阳从___升起” 的下一个词模型需要知道天文常识要预测一段数学证明的下一步模型需要理解推理逻辑。预测的质量上限取决于模型对世界的理解程度。因此预测下一个词是一个被迫理解的任务——只有真正理解了上下文才能做出准确的预测。第二压缩即智能。从信息论的角度看预测下一个词本质上是在对语言序列进行压缩。一个能精确预测的模型等价于一个能高效编码文本的压缩器。而要高效压缩自然语言模型必须捕捉语言背后的规律、知识与推理结构。Ilya Sutskever 等人多次强调足够好的下一个词预测必然要求模型建立起对世界的内部模型。第三语言是知识的载体。人类积累的大量知识以文本形式存在。当模型在海量文本上学习预测下一个词时它不可避免地要吸收文本中编码的世界知识、常识、推理模式。这使得一个纯粹的语言模型实际上学到了远超语言本身的东西。1.1.3 生成式与判别式建模在机器学习中我们常区分两类模型判别式模型建模条件概率P(y∣x)P(y \mid x)P(y∣x)直接判断输入xxx属于哪个类别yyy。例如文本分类、情感分析。生成式模型建模联合概率P(x,y)P(x, y)P(x,y)或P(x)P(x)P(x)可以生成新的样本。自回归语言模型建模P(x)∏P(xt∣xt)P(x) \prod P(x_t \mid x_{t})P(x)∏P(xt​∣xt​)是典型的生成式模型。判别式模型在特定任务上往往更高效但只能解决它被训练的那个任务。生成式语言模型则不同它学习的是语言的通用分布理论上可以用于翻译、摘要、问答、写作等几乎任何语言任务——只要任务能用续写文本的方式表达。这种以生成为核心、用统一方式解决多任务的特性正是大模型走向通用的关键。1.2 语言模型的发展历程理解大模型需要先了解它从何而来。语言模型的发展大致经历了四个阶段。1.2.1 统计语言模型时代20世纪90年代到21世纪初语言模型主要基于统计学方法。最具代表性的是N-gram 模型。N-gram 模型的核心是马尔可夫假设当前词的概率只依赖于前n−1n-1n−1个词而非全部历史P(wt∣w1,…,wt−1)≈P(wt∣wt−n1,…,wt−1)P(w_t \mid w_1, \dots, w_{t-1}) \approx P(w_t \mid w_{t-n1}, \dots, w_{t-1})P(wt​∣w1​,…,wt−1​)≈P(wt​∣wt−n1​,…,wt−1​)例如bigramn2n2n2模型假设当前词只依赖前一个词P(wt∣wt−1)P(w_t \mid w_{t-1})P(wt​∣wt−1​)。这些条件概率通过统计语料中词共现的频率来估计。N-gram 模型简单直观但存在根本性缺陷数据稀疏许多合理的词组合在训练语料中从未出现导致概率估计为零。长距离依赖缺失受限于nnn的大小无法捕捉远距离的上下文关系。无法理解语义纯粹基于词频统计无法获知猫和狗都是动物。为缓解数据稀疏研究者提出了各种平滑技术如 Katz 回退、Kneser-Ney 平滑对未观察到的事件分配少量概率。但这些方法治标不治本N-gram 模型的天花板依然很低。1.2.2 神经语言模型的兴起2003年Bengio 等人提出了神经概率语言模型这是一个里程碑式的工作。它的核心创新是引入了词的分布式表示distributed representation每个词被映射为一个低维稠密向量词向量。相似的词在向量空间中距离相近。通过神经网络而非词频统计来估计条件概率。这一突破解决了 N-gram 的两大痛点词向量天然缓解了数据稀疏相似词共享统计强度而神经网络可以拟合更复杂的上下文依赖关系。此后循环神经网络语言模型RNN-LM进一步提升了处理变长序列的能力。RNN 通过隐状态hidden state在时间步之间传递信息理论上可以捕捉任意长度的依赖htf(ht−1,wt)h_t f(h_{t-1}, w_t)ht​f(ht−1​,wt​)然而实践中RNN 受困于梯度消失与梯度爆炸问题难以有效学习长距离依赖。这一局限直到 LSTM、GRU 等门控机制出现才有所缓解但并未根本解决。1.2.3 预训练革命2013年前后Word2Vec和GloVe将词向量的思想推向高潮。它们能从大规模无标注文本中学到富含语义的词嵌入著名的例子是king⃗−man⃗woman⃗≈queen⃗\vec{king} - \vec{man} \vec{woman} \approx \vec{queen}king​−manwoman≈queen​这表明词向量空间具有某种线性的语义结构。然而Word2Vec 是静态的每个词只有一个固定的向量无法处理一词多义bank既是银行也是河岸。2018年ELMo提出了上下文相关的词表示用双向 LSTM 处理整个句子让每个词的表示随上下文动态变化。同年Transformer架构2017年提出开始在语言建模中大显身手。2017年Vaswani 等人在论文“Attention Is All You Need”中提出了Transformer。它完全摒弃了 RNN 的循环结构仅依靠注意力机制Attention来建模序列依赖。Transformer 的两大优势使其成为划时代的架构完全并行化所有位置可以同时计算训练效率远超 RNN。长距离依赖任意两个位置之间直接通过注意力交互路径长度为O(1)O(1)O(1)。Transformer 的诞生为后续的预训练模型铺平了道路本系列文章第二部分将专门剖析它。1.2.4 大模型时代Transformer 出现后预训练语言模型迎来爆发。2018年BERT编码器架构通过掩码语言模型在多项理解任务上刷新记录同年GPT-1解码器架构确立了预训练 微调的范式。真正的转折点是GPT-32020年。它拥有 1750 亿参数在 45TB 文本上训练。GPT-3 展示了一个惊人的现象无需微调仅通过提示中的几个示例few-shot模型就能完成各种新任务。这被称为上下文学习In-Context Learning是大模型区别于以往模型的关键能力。此后模型规模与能力持续攀升。GPT-4、PaLM、Gemini、LLaMA、Qwen、DeepSeek 等模型相继出现参数从百亿走向千亿、万亿能力从语言扩展到多模态、推理、Agent。2024-2026 年又涌现 GPT-4o/4.5/5、Claude 3.7/4/5、Gemini 2.0/2.5、Llama 4、Qwen3、DeepSeek-V3/R1 及后续 V4、Kimi K2/K3 等开源与闭源前沿的差距显著缩小。能力上推理模型o1/o3、R1把思考内化多模态走向原生GPT-4oAgent 从框架走向落地编码智能体、Computer Use。一个从专用模型到通用模型的范式转变已经完成。1.3 大模型的大在哪里“大模型这个名称容易让人误以为它仅仅是参数多”。实际上大是多维度协同扩展的结果。1.3.1 多维度的规模扩展维度传统模型大模型参数量百万级数十亿至万亿级训练数据GB 级TB 至 PB 级计算资源单 GPU数千 GPU 集群能力范围单一任务通用多任务这些维度并非独立而是相互制约、协同增长。更大的模型需要更多数据来充分训练更多数据又需要更大模型来吸收而二者都需要更多计算资源。这正是分布式训练第10章成为核心工程能力的原因。1.3.2 Scaling Law规模的力量2020年OpenAI 发表了Scaling Law缩放定律揭示了模型性能与规模之间的定量关系。研究表明在较宽的范围内模型的交叉熵损失LLL随参数量NNN、数据量DDD、计算量CCC呈幂律下降L(N)∝N−αN,L(D)∝D−αD,L(C)∝C−αCL(N) \propto N^{-\alpha_N}, \quad L(D) \propto D^{-\alpha_D}, \quad L(C) \propto C^{-\alpha_C}L(N)∝N−αN​,L(D)∝D−αD​,L(C)∝C−αC​其中α\alphaα是经验常数。这意味着只要持续增加规模参数、数据、计算模型性能就会持续、可预测地提升且提升趋势在双对数坐标下近似为直线。Scaling Law 的意义在于它把 scaling 能不能带来收益这个原本不确定的问题变成了一个可以预测的工程问题。它指导了此后几年大模型的训练规划模型该做多大、需要多少数据、要花多少算力都可以根据 Scaling Law 来估算。2022年的Chinchilla工作进一步修正了这一认识对于给定的计算预算存在一个计算最优的参数-数据配比约为D≈20ND \approx 20ND≈20N每个参数对应约 20 个 token。许多早期模型包括 GPT-3实际上是参数过多、数据不足的并未达到计算最优。这一发现深刻影响了后续模型的训练策略。1.4 大模型的核心能力大模型之所以引发变革在于它展现出一系列传统模型所不具备的能力。1.4.1 涌现能力涌现能力Emergent Abilities是指当模型规模超过某个阈值后突然出现的小模型所不具备的能力。典型的涌现能力包括多步算术推理符号操作如逆序单词模型在训练中从未被明确教授的复杂任务涌现现象的特点是突变在小模型上几乎为零的能力在大模型上会突然显现。这就像水到 100°C 才沸腾——能力不是线性积累的而是在某个临界点发生质变。需要注意的是涌现能力也存在争议。有研究指出部分涌现可能是评估指标如完全匹配造成的假象——若改用连续指标性能提升可能是平滑的。无论争议如何大模型在复杂任务上的表现远超小模型这一点是确定的。1.4.2 上下文学习上下文学习In-Context Learning, ICL是大模型最具标志性的能力。它指的是模型无需更新任何参数仅通过提示中提供的示例就能学会执行新任务。例如在提示中给出几个英文→法文的翻译示例模型就能翻译新的英文句子尽管它从未被专门训练过翻译。这在传统机器学习范式中是不可想象的——传统方法必须用标注数据重新训练或微调模型。上下文学习的意义在于它把使用模型的门槛从训练模型降低到了写提示词。这使得大模型可以被快速应用到无数新场景极大地拓展了其通用性。本系列文章第15章将深入讨论上下文学习的机制与提示工程。1.4.3 思维链推理思维链Chain-of-Thought, CoT是另一个重要发现。研究人员发现在提示中加入Let’s think step by step让我们一步一步思考或给出包含中间推理步骤的示例能显著提升模型在数学、逻辑等复杂推理任务上的表现。思维链的本质是让模型把推理过程写出来而不是直接跳到答案。生成中间步骤相当于为模型分配了更多的计算更多 token 的前向计算来处理复杂问题从而提升了正确率。这与人类打草稿解题的道理类似。1.4.4 指令遵循经过对齐训练alignment见第四部分的大模型能够理解并执行用自然语言书写的指令。用户无需了解模型的内部格式只需用日常语言描述需求模型就能按要求输出。这一能力极大降低了大模型的使用门槛使其从研究者的工具变成了大众可用的产品。指令遵循背后是监督微调SFT和人类反馈强化学习RLHF等技术的支撑。1.4.5 推理模型与测试时计算2024 年起大模型迎来一次重要的范式转变从单纯扩展训练计算转向同时扩展推理测试时计算。代表是 OpenAI o1/o3 系列与开源的 DeepSeek-R1。传统模型包括 GPT-4在给出答案前只生成简短输出推理计算量有限。推理模型reasoning model则在回答前生成长篇隐式思维链把大量计算投入到思考过程从而在数学、编程、科学推理等复杂任务上大幅突破。其核心思想与思维链1.4.3一脉相承但有两点质变思维链内化推理模型经专门训练自发产生长思维链无需用户在提示中引导。测试时计算扩展通过让模型在推理时生成更多思考 token把算力从训练阶段延伸到推理阶段。问题越难模型想得越久形成一种新的 scaling 维度–测试时计算test-time compute。DeepSeek-R1 进一步揭示一个惊人现象纯强化学习无需监督微调即可让模型自发涌现出长思维链推理能力R1-Zero并能通过蒸馏把推理能力迁移到小模型。这表明推理能力可通过 RL 直接激发而不必依赖大量人类推理示例。推理能力的常态化2025-2026推理模型很快从特殊产品变为标配。到 2025 年主流厂商把推理与非推理能力统一OpenAI GPT-5 用多模型 智能路由器按问题难度自动选用快速模型或深度推理模型Anthropic Claude 用混合推理同一模型在快速响应与扩展思考extended thinking间切换且思考时可调用工具Google Gemini 把思考能力直接内置。测试时计算从一个新趋势变为可由用户/系统控制的常规维度如思考预算“努力等级”Scaling Law 正式从单维训练扩展为双维训练 推理。测试时计算的兴起意味着 Scaling Law 从训练侧扩展到推理侧为大模型能力提升开辟了新路径也重塑了对推理效率的考量详见第13章 GRPO、第16章解码、第24章前沿。1.5 大模型的技术栈全景要全面理解大模型需要把握从数据到部署的完整技术链路。下图勾勒了这条链路┌─────────────────────────────────────────────────────────┐ │ 数据处理 │ │ 采集 → 清洗 → 去重 → 分词 → 配比 │ └──────────────────────────┬──────────────────────────────┘ ▼ ┌─────────────────────────────────────────────────────────┐ │ 预训练 │ │ 自回归预测下一个词万亿级 token │ │ 依赖分布式训练、优化器、稳定性 │ └──────────────────────────┬──────────────────────────────┘ ▼ ┌─────────────────────────────────────────────────────────┐ │ 监督微调SFT │ │ 指令数据 → 学会遵循指令、对话 │ └──────────────────────────┬──────────────────────────────┘ ▼ ┌─────────────────────────────────────────────────────────┐ │ 对齐训练RLHF/DPO │ │ 人类偏好 → 有用、无害、诚实 │ └──────────────────────────┬──────────────────────────────┘ ▼ ┌─────────────────────────────────────────────────────────┐ │ 推理与部署 │ │ 解码策略、KV Cache、量化、服务化 │ └─────────────────────────────────────────────────────────┘贯穿所有环节的是模型架构——以 Transformer 为核心配合各种改进如 RoPE、RMSNorm、GQA 等。本系列文章的章节正是沿着这条链路展开先打基础第一部分再剖析架构第二部分然后依次讲解预训练第三部分、对齐第四部分、推理部署第五部分最后展望扩展方向第六部分。1.6 本系列文章组织结构第一部分基础理论。夯实数学与机器学习基础为理解后续内容做准备。第二部分核心架构。深入剖析 Transformer 及主流大模型架构这是全书的核心。第三部分预训练。讲解如何从零训练一个大模型包括数据、分布式训练与优化。第四部分对齐与微调。介绍如何将基座模型转化为可用的对齐模型。第五部分推理与部署。覆盖高效推理与生产部署的工程实践。第六部分扩展与前沿。展望多模态、MoE、长上下文、Agent 等前沿方向。建议初学者按顺序阅读有基础的读者可根据兴趣跳读。每章末尾的延伸阅读提供了深入学习的论文线索。小结本章建立了大模型的全局图景。我们看到了语言模型从统计方法到神经方法、再到大模型的演进脉络理解了预测下一个词为何能通向通用智能认识了涌现能力、上下文学习等核心能力并勾勒了从数据到部署的完整技术栈。带着这幅全景图下一章我们将夯实理解大模型所需的数学基础——线性代数、概率论、微积分与信息论。这些工具将在后续每一章中反复出现。延伸阅读Vaswani et al.Attention Is All You Need(2017) — Transformer 的奠基论文。Kaplan et al.Scaling Laws for Neural Language Models(2020) — 揭示规模与性能的幂律关系。Wei et al.Emergent Abilities of Large Language Models(2022) — 系统论述涌现能力。Brown et al.Language Models are Few-Shot Learners(GPT-3, 2020) — 上下文学习的开创性展示。Hoffmann et al.Training Compute-Optimal Large Language Models(Chinchilla, 2022) — 计算最优配比的发现。DeepSeek-AI.DeepSeek-R1(2025) - 纯 RL 涌现推理详见第13章。OpenAI.GPT-5 System Card(2025, arXiv:2601.03267) - 推理与非推理统一的系统视角。
返回列表