ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI Agent_5 AI 大语言模型基础(LLM)

AI Agent_5 AI 大语言模型基础(LLM) 一、先建立直觉LLM 是什么请先忘掉 人工智能 这个唬人的词记住一个朴素画面给你出题青岛是山东的___。你会填什么——省会。LLM 干的事就是这件事只是规模大了几个数量级它不是查字典而是对词表里的每一个词打分选出概率最高的那个。你问它任何问题它都在做同一件事 ——续写一段最 像样 的文字。关键认知新手最容易误解的三点误解真相LLM 是 数据库 / 搜索引擎不是。它的知识是 压 在参数里的统计关联不是逐条存储LLM 知道 答案对不对不知道。它只知道 这么说最像人话LLM 每句话都是查证过的不是。它可能一本正经地编造幻觉后面细讲为什么这反而很有用语言是知识、逻辑、指令的载体。当一个模型 极擅长续写人话 时续写 请帮我写一封请假邮件…… 就约等于 执行指令。这就是 LLM 能成为一切 AI 应用地基的原因。二、语言的基本单位TokenLLM 不按 字 或 词 处理语言而是按token词元。示例今天天气真好 可能被切成[今天] [天气] [真] [好]4 个 token也可能切成更细的子词取决于分词器。分词器Tokenizer主流用BPE字节对编码—— 高频词整体保留低频词拆成常见子词。比如英文unbelievable可能拆成unbelievable这样模型不需要为每个生僻词单独建槽位。词汇表常见模型几万到几十万个 token。模型输出层的 打分就是给这几十万个候选词逐个打分。上下文窗口模型一次能 看 的 token 上限几千到上百万。窗口是 LLM 记忆的物理边界 —— 上一讲 Agent 的 短期记忆 就受它约束。三、核心机制一自回归 预测下一个词这是 LLM 最重要的一张图。模型工作时就是在 输入序列 → 打分 → 采样 → 拼回输入 → 再来一轮 的循环里转机制逐条解释打分LLM 把输入序列编码成向量经过几十上百层 Transformer 后最后一层对词汇表里每个词输出一个分数logits。分数来自模型在训练中见过的统计模式 —— 它见过大量 青岛是山东的省会 这类文本所以 省会 这个位置的分数最高。Softmax把原始分数转成概率分布和为 1。图中 省会0.60、城市0.25…… 这些是示意数值。采样从分布里 抽 一个词。这一步有讲究贪心解码永远选概率最高的省会→ 稳定但死板、容易重复温度temperature调节分布的 陡峭程度—— 温度低如 0.1几乎总是选最高分适合写代码、算术温度高如 1.5分布变平坦敢选 冷门词适合写诗、编故事Top-p核采样只从累计概率达 p 的候选里抽把 明显离谱 的词排除掉。循环选中的词拼回输入再预测下一个 —— 直到模型输出专门的 结束 标记。这就是 打字机效果 的底层原因不是 UI 在慢慢显示而是模型真的在逐词生成。实际价值理解了 预测下一个词你就理解了为什么 LLM 能写文章续写、能翻译续写另一种语言、能编程续写代码——所有任务都被统一成了 续写 这一个动作。四、核心机制二注意力与上下文上一讲已经拆过 Transformer 注意力内部Q/K/V这里只看 LLM 特有的两个点上下文 模型 看见 的全部输入。你的问题、历史对话、系统设定全被拼成一段 token 序列一起喂给模型。模型没有 读取记忆 的能力 ——它只根据当前窗口里的内容回答。窗口是硬边界。示例你和它聊了 30 分钟、超出 128K 窗口后最早的内容可能被截断或压缩它就 忘了。这就是为什么长文档处理要用 分块 检索上一讲的 RAG而不是把所有内容硬塞进去。五、核心机制三涌现能力不用训练就会的新本事LLM 最神奇的一点训练时只学了 预测下一个词但到一定规模后它 无师自通 了一些新能力。这被称为涌现能力Emergent Ability—— 小模型没有、大模型突然出现的本领。示例 1上下文学习In-Context Learning你不需要微调模型只要在问题前给几个例子例子 1句子 天气很好 → 改写为感叹句 天气真好啊 例子 2句子 他考了满分 → 改写为感叹句 他居然考了满分 问题句子 晚饭真香 → 改写为感叹句模型会照猫画虎输出 晚饭真香啊。机理解释注意力机制让模型在上下文里 现场找规律—— 它发现 句子 → 感叹句 的模式并把它套用到新输入上。参数一个没动能力却 现场长出来 了。示例 2思维链Chain-of-Thought, CoT问鸡和兔共 10 个头、28 只脚各几只 直接答容易错。但如果让模型 一步步想假设全是鸡10 头 20 脚实际 28 脚多 8 脚每把一只鸡换成兔多 2 脚8 ÷ 2 4 → 4 只兔、6 只鸡。机理解释把推理过程拆成中间步骤写在输出里每一步都是 局部简单的预测错误率远低于 一步到位 的跳跃式预测。这就是为什么现在的模型都默认 先思考再回答。六、LLM 能做什么能力谱系与示例能力示例机理一句话续写 / 创作写一首关于大海的短诗续写训练时见过海量诗歌模式翻译猫坐在垫子上 → The cat sat on the mat预训练语料中中英文本交错出现注意力把两种语言语义对齐摘要给一篇 5000 字新闻 → 100 字要点注意力权重高的句子 / 关键信息被加权保留问答光合作用的原料是什么参数中 压 着语料里的知识关联代码生成用 Python 写斐波那契函数代码在语料中量大且规律极强最容易 续写推理三个苹果吃了两个还剩几个语言模式 思维链机制多模态看图描述、听语音转文字视觉 / 听觉先 翻译 成 token上一讲已展开示例展开 —— 翻译的机理模型在预训练时读了海量 中英对照 或 双语混排 的网页注意力在训练中学会了 中文 猫 的向量和英文 cat 的向量语义上指向同一概念。翻译时它就是在 用另一种语言续写同一个意思。七、LLM 是怎么训练出来的三阶段一个大模型要变成 好用且安全 的助手要连续精调三遍机制补充说明预训练为什么用 预测下一个词因为文本本身就是免费的标签 —— 任何一个句子的 后半句 就是 前半句 的标准答案。这让模型可以从整个互联网的文本中自学不需要人工标注这是大模型能做大的根本原因。RLHF 具体怎么跑让人对同一问题的多个回答排序A 更安全、B 更有帮助→ 训练一个 奖励模型 模仿人的打分 → 用强化学习PPO调整大模型让它更倾向于输出高分回答。今天更流行的 DPO 则跳过奖励模型直接根据偏好数据优化更简单稳定。对齐的价值模型 拒绝危险请求如不提供自伤方法、不教违法犯罪不是天生就会而是对齐阶段被训练出来的行为。八、LLM 的 坏毛病幻觉与局限新手必看幻觉Hallucination模型一本正经地编造事实。示例问 某本 2025 年出版的书讲了什么模型可能煞有介事地编出一个书名和目录 —— 因为它 续写 得很流畅但没有任何事实核查。机理解释模型的训练目标从来都是 像不是对。它只优化 这句话在统计上像人类写的 没有 去查证 的通道。当某个问题超出它知识范围时它不会说 不知道 而是会 编一个最像样的答案 。缓解手段RAG检索增强让它先查资料再回答、工具调用上一讲的 Agent 就是为此设计的、人工审核。所以重要事实类问题永远要以工具查证结果为准。其他常见局限知识截止训练数据有截止日期之后的新事它不知道需要联网工具补。上下文有限窗口外的内容 看不见。数学与计数弱大数乘法、复杂计数容易错所以要让它用代码计算器。立场与偏见模型会放大训练数据中的偏见这也是对齐阶段要持续治理的。九、实践价值与学习路径价值LLM 是过去十年 AI 领域最大的 平台级 突破 —— 一个模型统一了写作、翻译、问答、编程、多模态理解再叠加 Agent 的记忆与工具就能变成 能办事的助理前两讲的完整链路。给新手的四步路径玩多用几款大模型产品观察它们在不同任务上的表现差异建立手感。懂把本文的 自回归循环 三阶段训练 讲给朋友听能讲清楚 真懂了。拆用开源工具Ollama 本地跑小模型改 temperature/top-p亲手看概率分布变化用提示词实验 few-shot 和 CoT 的效果。建调一个开源小模型LoRA 微调或基于 API 做一个带 RAG 和工具的小应用把前面所有概念串成实物。一句话总结LLM 在万亿文本上用 预测下一个词 的方式训练出来的巨型概率模型它靠自回归循环生成内容、靠注意力理解上下文、靠三阶段训练获得知识 / 听话 / 安全三种能力它的强大来自规模它的错误幻觉也来自 只求像、不求对 的本性。理解这四条你就真正入门了大语言模型。
返回列表