ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

LLM Cookbook 新手指南:一次看懂这套 LLM 实战教程

LLM Cookbook 新手指南:一次看懂这套 LLM 实战教程 LLM Cookbook 新手指南一次看懂这套 LLM 实战教程【免费下载链接】llm-cookbook面向开发者的 LLM 入门教程吴恩达大模型系列课程中文版项目地址: https://gitcode.com/GitHub_Trending/ll/llm-cookbookLLM Cookbook 是 Datawhale 把吴恩达大模型系列课做成中文版的 LLM 实战教程11 门课全是可运行的 Notebook从写 Prompt 到 RAG、微调带你把大模型 API 调成能交付的系统适合会一点 Python 的开发者。它解决的问题先说一个常见卡点。你会一点 Python公司让你给内部文档加个问答机器人你打开 API 文档就开始卡住Prompt 到底该写多细模型不看你的文档、自己编了个答案你也不知道该改指令还是改数据只能反复碰运气。再一个是资料问题。网上的教程要么只有英文版要么东一篇 LangChain、西一篇 RAG顺序完全不知道从哪开始就算把官方示例跑通了也不知道中文语境下效果会不会打折扣更不知道自己离能交付还差几步。这个仓库的做法是把 11 门课按由小到大排好每一步都给你可运行的 Notebook 和中文对照说明从写对一条指令到检索挂上私有文档再到该不该微调一路都有代码兜着。课程 Notebook 都在 content/ 目录文字版教程在 docs/ 目录两种读法随你挑。 让模型听懂你的指令写好第一条 Prompt任务目标把模型 API 调通让它稳定干成一件事比如总结一条用户评论并且同样的输入每次都能得到可预期的输出。会遇到的概念LLM大语言模型。它是一台按最小单位逐块读写的文本机器输出的每个字都是模型对下一块该是什么的判断。在这套教程里它以 API 端点的形式出现——你发一段消息过去它回一段文本必修课程完全不碰它内部你只管调用。误区是把它当成全知全能它的知识停在训练数据那一刻你公司内部的文档它一个字都不知道后文的检索就是为这个短板补的。Token。模型读写的不是字也不是词而是分词器切出来的一小块中文大致一个汉字一块英文一小块顶不到一个单词。必修课程的 Notebook 里都封装了辅助函数每次调 API 都会把消耗的 Token 数一并返回让你对每次对话占多少篇幅有数。别以为模型是逐字操作的像番茄这种词在模型眼里是一整块让它逐字倒序它做不到只能整块搬动。上下文长度上限也是按输入 Token 输出 Token总共算的塞得越满能生成的越少。Prompt。就是你发给模型的完整指令包含背景、要求和格式而不是只甩一个问题。必修一课程从它讲起围绕总结、推断、转换、扩展四类任务反复练仓库里还专门做了一套效果相当的中文 Prompt让你能对比模型在中文语境下的表现。误区是觉得 Prompt 一次写好就完事仓库给的做法是迭代先拿十来条真实样本跑一遍把答错的归归类再针对性地改指令。Chat 格式。模型接收消息的格式把一次对话拆成几条带角色的消息system 消息负责定规矩和身份user 消息负责提具体任务。必修二的 Notebook 里所有请求都以 messages 列表发给 API仓库示例就是先放一条 system 交代你是个什么助手再由 user 提问。它和单条 Prompt 不是一回事把身份、格式、任务全糊在一条长消息里模型行为容易飘分层之后规矩归 system任务归 user各管一段。容易踩的坑指望一次写好 Prompt。正确姿势是试一批 → 分析错在哪 → 改指令转圈改哪句都该有对应的那类错误而不是加一堆重复的要求。答案不对就去拧 temperature。它只控制输出的随机程度答案错了先查指令和输入参数救不了逻辑问题。 给模型挂上自己的文档五步跑通 RAG 问答任务目标让模型只依据你自己的私有文档PDF、网页、表格作答不许它凭记忆瞎编。会遇到的概念RAG检索增强生成。它把模型当成只会照着资料答题的人回答之前先去你的文档里把最相关的几段捞出来连同问题一起交给模型。必修四是它的完整主线文档加载、切块、向量化、入库、检索、拼 Prompt、出答案一步步给代码。误区是以为 RAG 就是把整篇文档塞进 Prompt——它只取最相关的少数几块文档本身不进模型参数知识想加想删随时动手。Embedding文本向量化。把一段文本转成一串数字让意思相近的文本数字上也相近于是找相关的变成了找最近的。必修四里切好的每个文档块都过一遍 Embedding 模型变成向量入库用户的问题同样转成向量再去比对。别用关键词搜索的眼光看它它比的是语义把原句换个说法照样能命中反过来两句关键词重合但意思不同的话距离可能很远。向量数据库Chroma。存放这些向量、能按距离快速找出最相近几条的本地工具你可以把它理解成一本按远近翻的通讯录。仓库里用的 Chroma 直接存在本地文件夹你的文档建成向量库后数据不出自己的机器。它和普通数据库不同你不用写 SQL丢一个向量进去它把最近的几个块还给你。文档切块。把长文档切成大小适中的段落再向量化是整条管线的地基。必修四用 RecursiveCharacterTextSplitter 同时设块大小和重叠区间让切点尽量落在句子边界上。坑有两个方向块切太大检索回来一大坨无关内容挤爆上下文切太小一句话被拦腰截断语义没了模型只能靠半句话硬答。容易踩的坑同一份 PDF 建库时重复导入检索回来全是重复块答案看着对其实是同一段说了两遍。问题里带第三页第二章这种定位词向量检索只认语义不认序号容易答非所问。选修课里的查询扩展、重排序就是逐个治这类毛病。 把单点能力串成完整应用LangChain 组件这样搭任务目标不手写胶水代码用现成组件把检索 → 填模板 → 调模型 → 解析输出串成一条问答流水线并且能多轮追问。会遇到的概念LangChain。一个把 LLM 应用常用零件做成现成组件的 Python 框架检索、模板、解析器都能拿来即插。必修三逐个讲它的组件模型、提示模板、输出解析器、存储必修四再展示预制的问答链——你把向量库和模型挂上去问一句话它自己走完整个流程。误区是把它当先决条件去背如果切块、向量化、检索、回答这四步你自己说不清框架跑得再顺你也看不出答案错在哪一步。Chain模型链。LangChain 里把多个步骤按固定顺序串起来的传送带进一头出答案。仓库里的 RetrievalQA 就是一条链问题丢进去自动完成检索、拼 Prompt、调模型直接吐答案。它和 Agent 要分清Chain 的路线写死在代码里每步干什么你说了算Agent 的路线是模型现场决定的灵活但不可控。Memory记忆。保存多轮对话状态的组件让机器人接得上话。没有它每问一句都像初次见面模型不知道上一轮聊到哪必修三的聊天机器人示例就是给链挂上 Memory 之后追问才成立。注意它和模型自己的记忆不是一回事模型本身什么都不记得是框架把历史消息重新拼回输入里。交叉编码器重排序。基础向量检索是快而粗的第一遍筛选交叉编码器再拿问题和每个候选块逐对细读、重新排座次把真正对的块顶到前面。选修的 Chroma 高级检索课里有完整实现先粗筛、再精排专治检索结果八九不离十但排序不对。代价是比单遍向量检索慢粗筛就够准的场合不必上。![LLM Cookbook LLM 实战教程交叉编码器重排序原理粗筛候选块后逐对精读再排序](https://raw.gitcode.com/GitHub_Trending/ll/llm-cookbook/raw/6ba398118fb47a75889d9c8d49d3ac7b5de2f1af/content/选修-Advanced Retrieval for AI with Chroma/images/交叉编码器运行原理图.png?utm_sourcegitcode_repo_files)容易踩的坑把框架当黑盒只背调用顺序。先把四步原理吃透出问题时才能定位到是检索错了还是 Prompt 拼错了。一上来就让模型自己决定调什么工具。那是 Agent 的玩法灵活但容易跑偏单点任务用 Chain 更稳。把答案质量兜住该检索、调参还是微调任务目标当改 Prompt 到头了判断该走哪条路提升效果并且能用数字证明确实变好了。会遇到的概念微调Finetuning。用你自己的数据再训一轮模型让它输出的格式、风格贴合特定要求。仓库的选修课结合 lamini 平台讲数据准备、训练、评估的全流程步骤清单从先想清任务到再堆数据再到最后才上更大模型顺序别颠倒。它和 RAG 是互补不是替代微调把知识烤进参数里之后想删都删不干净知识天天变的优先走检索。评估Evaluation。建一组标准问题加打分口径量化改了之后到底好了还是坏了。选修的 RAG 评估课给了完整框架答案相关性、上下文相关性等指标由另一个模型来打分跑一遍有分数才敢上线。误区是拿单个这条答得不错下结论——一次好答可能是运气批量标准问题才能看出趋势。![LLM Cookbook LLM 实战教程微调大语言模型的实用步骤从定义任务、准备数据到评估迭代](https://raw.gitcode.com/GitHub_Trending/ll/llm-cookbook/raw/6ba398118fb47a75889d9c8d49d3ac7b5de2f1af/figures/Finetuning Large Language Models/6_微调实用技巧.png?utm_sourcegitcode_repo_files)容易踩的坑把经常变动的知识蒸进参数里下次更新又得重训一遍。没有评估集就动手调参或微调改完不知道是进步还是回退。选哪条路Prompt、RAG 与微调怎么选三条路线改的东西不同先看清问题出在哪再决定动哪里路线改的是哪里适用场景代价 / 局限改 Prompt 与参数不动模型只改这次对话的输入输出格式不稳、风格不对、需求临时变化改到一定程度收益递减硬格式压不住RAG 检索给模型换资料知识随时增删答案依赖私有文档且文档经常更新受检索质量制约检索错了答案必错微调改模型参数本身稳定的输出格式、领域用语、固定风格数据质量要求高效果不可逆有训练成本一个判断口诀资料能查到的问题先检索检索解决不了、且属于长期稳定的格式或风格要求再考虑微调。新手最容易问的 4 个问题跑这些课程需要买 GPU 吗不需要。必修课程全部通过 API 调用模型一个 API key 加 Jupyter 就够微调课程也走云平台训练不占本地显卡。RAG 不就是把文档塞进 Prompt 吗不是。它只检索最相关的少数几块塞进去整篇硬塞既撑爆上下文又推高成本模型注意力还会被无关内容稀释。Prompt 写得越长效果越好不是。仓库的做法是先归因错误再补对应的那句指令把同一条要求换个说法重复三遍只是白花 Token。学 RAG 之前必须先学 LangChain 吗不必。RAG 本身是切块、向量化、检索、作答四步的思路LangChain 只是实现它的方式之一思路先懂用哪个框架都能定位问题。从环境到跑通第一课5 步上手指南克隆代码库git clone https://gitcode.com/GitHub_Trending/ll/llm-cookbook装好 Anaconda 和 Jupyter具体步骤见环境配置教程申请一个 LLM API key按教程里的格式存进项目根目录的 .env 文件打开必修一的 Prompt 课程代码把第 2 课的示例从头跑到尾进必修二第一课留意每次调用返回的 Token 数建立每次对话有多贵的手感写在最后这套教程的价值在于每一步都有可运行的代码托底Prompt、检索、微调都不是停在概念而是你亲手改过、跑过、看过输出差的。跑通一个 Notebook 之后剩下的路会越走越顺因为每个概念你都见过了。今天就可以做的动作克隆仓库打开必修一第 2 课改两条指令对比输出差异。【免费下载链接】llm-cookbook面向开发者的 LLM 入门教程吴恩达大模型系列课程中文版项目地址: https://gitcode.com/GitHub_Trending/ll/llm-cookbook创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表