ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

企业大模型行业化实战:持续预训练(CPT)全流程指南

企业大模型行业化实战:持续预训练(CPT)全流程指南 先聊一个我自己踩过不少坑的话题企业做AI应用最难受的往往不是算力不够而是“通用大模型什么都懂一点、什么都不精”的状态。开个行业会议它能把概念说得头头是道一落到具体的业务文档、工艺参数、内部规范、产品数据库它就露馅了——要么答非所问要么一本正经地编。这时候最常被问到的一个问题就是“我们能不能把通用模型训练成我们行业自己的模型”能而且实践起来有清晰的技术路线其中最关键的一步就是 Continued Pre-Training也就是持续预训练圈内一般直接叫CPT。这篇文章就是一份实战向的CPT指南面向企业中正在做或准备做大模型私有化、行业化的算法工程师、技术负责人和架构师。内容覆盖为什么需要CPT、CPT和微调到底什么关系、数据怎么准备、训练参数怎么定、评估怎么做、部署上线有哪些坑以及整个流程怎么和业务闭环。我会结合自己做过的项目把能复用的思路、参数范围和工程细节都写出来尽量让一个有一定大模型基础但没实际跑过CPT的团队也能照着这份指南把流程走通。1. 先理清楚CPT在整个大模型落地链路里到底扮演什么角色很多团队一上来就想着“用业务数据微调一下模型”结果微调完效果依然不行。原因很简单微调改变的是模型的“行为方式”而不是模型的“知识底座”。CPT干的事情恰恰是把行业知识写进模型的参数里让模型在生成时真的有内容可以调用。1.1 通用模型“不通用”的尴尬为什么行业场景必须二次训练我见过不少企业客户最开始都抱着“找一个很强的开源模型直接用”的想法。结果一旦把真实业务问题丢过去马上就会发现三个典型问题领域术语理解不到位模型把“熔接”“退火”“游离氧化钙”这类专业词当普通词汇处理私有知识完全空白公司的历史报告、设备日志、项目文档、专家经验模型从来没在训练数据里见过格式和风格不匹配模型生成的内容像是学术论文或百科条目而不是行业里真正在用的报告、工单、审批意见。打个比方可能更好理解通用模型像一个接受过通识教育的毕业生知识面很广但没在行业里干过一天活。你直接让他上岗写行业分析报告他只能照着通用的模板编内容经不起推敲。CPT就相当于让这个毕业生去行业里实习三个月天天看行业资料、做行业题目把行业里的“常识”内化成自己的东西。这个阶段之后模型才算真正“懂行”。从技术上讲预训练阶段决定了模型的知识上限指令微调决定的是模型的服从度和表达风格人类反馈对齐决定的是价值观和安全性。CPT就是在预训练这个层面做文章它的目标是在尽量不破坏模型原有通用能力的前提下把特定领域的知识、术语、语法模式、逻辑形式压进模型参数里。所以CPT不是微调的替代品而是微调的前置步骤两者配合起来才是完整的行业化路径。1.2 CPT、SFT、RLHF分别解决什么问题一条链路别搞混把这条链路拆清楚团队在分工时就不会打架。我见过一些项目组为了省事跳过CPT直接拿几千条业务问答数据做SFT结果模型回答得“像模像样”但是内容没有支撑本质上是模型在复读话术而不是真正理解业务逻辑。这就是典型的跳过了知识注入环节导致的。CPT持续预训练对应的训练数据是未标注的行业文本语料比如行业论文、技术手册、历史工单、法规政策、内部知识库条目目标是让模型学习领域知识和语言模式。SFT指令微调对应的是成对的指令-回答数据比如“这个故障代码是什么意思——故障代码E021表示传感器信号丢失”目标是让模型学会按指令要求输出答案。RLHF / RLAIF人类/ AI反馈强化学习对应的则是一组偏好排序数据比如同一问题的多个回答人工标注哪个更好目标是让模型的回答更符合人类偏好和安全规范。实际落地时我建议的顺序是先做CPT把行业知识灌进去再做SFT让模型学会用行业知识回答问题如果对安全性和风格有硬需求再追加一轮偏好对齐。跳步省时间的团队后面大概率要回头补课。1.3 为什么是“继续预训练”而不是直接全参微调、LoRA、QLoRA很多人容易混淆CPT和微调的差异。微调是在一个已经训练好的模型上用有监督数据调整模型的输出行为它更多是改变模型“怎么回答”。而CPT本质上是把预训练再往前推一步用的是连续的大段文本通过语言建模损失就是预测下一个token来更新模型它改变的是模型“知道什么”。训练目标不同决定了数据和超参配置都不同。那能不能用LoRA或QLoRA来做CPT呢能用但效果有折扣。LoRA通过低秩矩阵近似参数更新更新量被限制在低维子空间里对于指令微调这种“改变行为”的需求够用但CPT需要把大量新知识写进模型知识注入本质是对模型内部知识表征的较大幅度的修改低秩更新的表达能力在这个场景下偏弱。我自己实测下来纯粹用LoRA做CPT领域困惑度下降得慢而且后续接SFT时容易反弹。相比之下全参数CPT的稳定性好很多。如果算力实在紧张折中的方案是用LoRA做小规模尝试定数据配方最终效果达标前切换到全参数训练。1.4 基座模型选型为什么优先选base模型而不是chat模型做CPT基座选择是个战略问题。我的建议很明确主选base模型不要用chat模型。base模型是只经过预训练、没有经过指令微调和对话对齐的基础模型它的知识分布最原始、最“纯净”。用base模型做CPT行业知识可以比较直接地注入参数后续想怎么塑形走SFT、走DPO都有操作空间。chat模型则已经经历过对齐模型参数里有很多“对话模板”和“安全拒答”的痕迹直接用业务文本做CPT一方面行业知识注入会受到既有分布的干扰另一方面后续对齐目标不明确容易训练出“四不像”。具体到选哪个开源基座中文行业场景我首选Qwen系列比如Qwen2.5-7B/14B/72B中文覆盖度高、生态好、许可证对企业相对友好其他备选还有Yi、DeepSeek、GLM系列。7B适合场景垂直、推理成本敏感的项目14B是性价比的甜点区72B适合对效果要求高、算力充足的核心场景。业界很多“行业大模型”的底座其实就是这些开源模型加CPT加SFT组合出来的。2. 动手之前硬件规划、数据治理和训练框架选择CPT不是从命令行敲一条命令就开始的它更像是“七分数据三分训练”。数据质量决定了效果上限硬件和框架决定了你能不能把上限拿到手。这个阶段准备工作做得越细后面训练越顺利。2.1 硬件与训练规模怎么算一张表看清显存需求先说大家最关心的算力估算。全参数CPT更新所有模型参数显存需求远大于微调。一个粗略的估算方法是混合精度训练下模型参数、梯度、优化器状态分别占用内存以AdamW优化器为例每个模型参数大约需要2字节bf16参数 2字节梯度 4字节一阶动量 4字节二阶动量再加激活值、通信缓冲区等粗略按每个参数16~20字节估算比较稳妥。一张含16GB显存的显卡最多只能折腾很小尺寸的模型要跑7B全参数CPT显存需求通常在110GB以上再加上激活值4×A100 80G是比较踏实的起步配置。下面这张表是我在不同项目里的实际配置总结给大家一个参考模型规模全参数CPT建议显存推荐硬件方案推荐场景1.5B~4B40GB以上1~2×A100 40G / 1×A100 80G垂直任务、轻量场景、快速验证7B~8B120GB以上4×A100 80G / 8×L40S行业级应用性价比均衡14B240GB以上8×A100 80G / 4×H800效果要求高的行业核心场景32B~72B1TB以上8×H100/H800以上多机旗舰级行业底座如果显存实在不够可以用QLoRA这类量化参数高效微调技术跑CPT小规模试验但正式投产前一定要用全参数或高rank的LoRA做一轮完整训练否则效果会打折。数据规模方面一般行业语料做到5亿到20亿token能让模型产生比较明显的变化低于1亿token基本看不出效果。这个数字听起来很大但如果你手头有几万份文档每份平均几百到几千字做个清洗和拼接后其实很容易就凑到几亿token。2.2 训练数据治理比模型训练更花时间的脏活累活数据是CPT的重中之重没有之一。我自己做项目时数据清洗和治理的时间通常占整个项目周期的60%以上。很多人一开始不在乎直接拿一堆PDF扔给模型跑完训练发现领域知识没涨反而通用能力崩了一大截回头查数据才发现里边混了大量乱码、重复段落、以及和领域无关的杂谈。这不是罕见案例而是新人最容易踩的坑。数据治理流程一般是四步第一格式清洗。把PDF、Word、扫描件、网页全部转成纯文本。PDF有表格的要保留表格结构能转成Markdown或JSON结构最好无用的页眉、页脚、页码、超链接、乱码符号要去掉。这个阶段推荐用OCR工具加版面分析模型配合人工抽检保证批量处理的质量。第二语言过滤和质量过滤。用语言识别工具过滤掉非目标语言的段落。质量过滤可以用启发式规则比如按字符长度、符号占比、重复度打分也可以用基于困惑度PPL的模型来做粗筛。低质量的广告、营销、口水文要优先去掉。第三去重而且是深度去重。行业语料中同一份资料可能在不同位置反复出现直接喂进去会让模型过拟合训练时loss看着降得很快实际评估时泛化很差。去重我用两招一是MinHash做全文去重二是Embedding相似度做语义去重。两者结合基本能把重复文本清理干净。第四段落切分与拼接。模型的训练序列长度一般是4096或8192个token所以要把清洗后的文本按段落或语义块拼接成定长序列。这里有个细节不要把截然不同的主题硬塞进同一个训练序列否则模型学到的上下文逻辑会变乱。更好的做法是按文档聚合同一文档的内容尽量出现在同一个训练序列里文档之间用特殊分隔符隔开。数据配比也是门学问。行业语料和通用语料的比例我建议从1:9到3:7之间调整。如果纯用行业语料训练模型在行业任务上提升最明显但通用能力会出现遗忘表现为常识问答、指令跟随质量下降。如果通用语料占比太多行业知识又灌不进去。实际操作中我一般先把行业语料用3倍过采样跑通小规模实验确认能涨点后再按2:8或3:7的行业通用混合比做正式训练。通用语料可以直接复用开源的数据集比如一些公开的清洗过的中文语料但要先采样一批人工检查质量。2.3 训练框架为什么推荐Megatron-LM和DeepSpeed的组合做全参数CPT光靠Hugging Face的Trainer跑不动大规模并行训练。HF的Trainer做单卡或多卡数据并行还可以但一旦模型大到需要张量并行、流水线并行、序列并行它就显得力不从心。更麻烦的是HF Trainer在分布式下的检查点保存和恢复机制不够稳定而CPT训练动辄跑几天一旦中断恢复不好就是灾难。生产环境我比较推荐两条路线一条是Megatron-LMNVIDIA开源做核心并行引擎配合DeepSpeed做ZeRO优化这套组合在业界用得最多稳定性和性能都经得起考验。另一条是直接用国产的Colossal-AI或国产大模型框架在中文社区和文档支持上有优势。如果团队对Hugging Face生态更熟悉可以先在HF上做小规模验证正式跑大规模全参数CPT时再切到Megatron-LM。关于微调的分类这里多说一句如果你想用LoRA做轻量级CPT用Hugging Face的PEFT库配Transformers就够了简单上手快如果你的目标是全参数训练就要做好用Megatron-LM/DeepSpeed这类重型框架的心理准备有一定学习成本但这是企业级项目绕不开的一步。3. 训练实操超参数、稳定性控制与灾难性遗忘准备工作做完终于进入正式训练。这个阶段的核心词是“稳”。CPT训练不像SFT那样几十步就能看到明显效果它更像熬汤火候、时间、原料都对了才能出味道。这里我把关键的超参数设置、训练监控手段和常见工程问题逐一展开。3.1 训练超参数怎么定从学习率到序列长度CPT的超参数推荐值和SFT差别比较大。先给一组我验证过多次的基线学习率Learning Rate全参数CPT建议1e-5到5e-5之间LoRA版CPT可以放到1e-4到3e-4。学习率过大会导致灾难性遗忘过小则知识注入太慢。我习惯先用3e-5跑一个2亿token的小实验看loss曲线和领域评测集的表现再调整。Batch Size推荐总batch size即global batch size保持在512~2048个序列之间。序列长度设4096时2048这个batch意味着单步要看800多万token这对模型学习稳定很有帮助。训练轮数Epochs如果行业语料是几亿到十几亿token通常1个epoch就够。不要盲目加轮次数据重复太多模型容易过拟合行业任务上可能会背答案换一个新输入的同类问题反而不会了。最大序列长度Max Length一般取4096或8192。序列越长模型能捕获的长程依赖越强但显存和算力开销也随之上涨。14B模型跑8192长度显存压力会大很多建议先从4096起步。学习率调度用cosine decay余弦退火比线性warmup加固定学习率更平滑最后1000步可以把学习率衰减到峰值的10%左右。我自己写训练脚本时一般会在配置里留几个关键开关方便做对比实验是否冻结embedding层、是否对attention模块做额外dropout、数据混合比是否动态调整等。这些开关在正式跑之前会做一两组小实验来定最终值。3.2 训练过程中的Loss怎么看Pro Tips很多新手训练时只看训练集的loss这是不对的。训练集loss下降是必然的但它可能来自对训练数据的过拟合。更重要的两个指标是验证集困惑度Validation PPL和领域评测集指标。每隔固定的步数比如500步保存一个检查点用一份独立的行业样本不要和训练集重合计算PPL观察它是否在持续下降。如果训练集PPL在降验证集PPL不降甚至上升说明模型开始过拟合这时候要么提前停止要么调低学习率要么增加通用语料的比例。另外建议训练过程中记录每个batch的梯度范数gradient norm。正常的梯度范数应该在0.0到10.0之间波动如果出现突然跳到几百甚至上千说明数据里混入了异常样本需要立即检查batch内容。我遇到过几次loss突然飙到正常值十倍的情况排查后发现是某份PDF转换时产生了大段乱码模型在硬学乱码的“规律”。这种异常早发现早处理能让整个训练过程平滑很多。3.3 灾难性遗忘怎么防通用语料回放是核心手段灾难性遗忘是CPT最典型的痛点。模型学到行业知识的同时把通用能力丢掉了常识问答变差、逻辑推理变弱、指令跟随不稳定。要缓解这个问题最有效的方式是通用语料回放General Corpus Replay。具体做法就是前面提到的混合训练让训练数据里始终有一部分通用语料这些通用语料最好是高质量、覆盖广的能让模型在更新知识的同时维持原有的通用能力。这里分享一个更细的操作经验混合比例可以动态调整而不是一条直线定死。举个例子训练初期行业语料占比可以高一点比如30%目的是快速注入行业知识训练中后期行业语料占比逐渐降到10%让模型在原有通用能力上“复习”一轮同时继续吸收行业模式。这个动态衰减策略比固定比例更能平衡知识注入和通用能力保持。另外一个减轻遗忘的手段是“小学习率更长的训练步数”。有些团队为了赶进度把学习率拉到8e-5结果5亿token之后模型通用能力明显退化。后来降到2e-5效果反而更好领域能力提升和通用能力保持都更理想。所以说CPT训练别贪快稳才是第一位的。3.4 训练中断、断点恢复和随机种子一致性CPT训练周期长服务器偶发宕机是家常便饭。不做好检查点管理辛苦跑了两天的训练可能白费。我强烈建议每500~1000步保存一次完整的检查点保存内容包括模型权重、优化器状态、学习率调度器状态、数据加载器位置和随机种子。这样即使中断也能无缝恢复。在Megatron-LM里检查点保存到本地磁盘和异步保存到对象存储是两回事。我是先把检查点存到本地NVMe盘训练继续跑同时后台异步把检查点同步到远端的对象存储防止整机磁盘损坏导致全部丢失。同步完成后会在日志里打一个标记训练恢复时优先从远端拉取检查点。随机种子的一致性也同样重要。CPT训练如果中途重启数据顺序必须和原来保持一致否则数据加载器会把数据重新打乱即使加载了模型权重训练曲线的连贯性也会被打破。配置好seed并保存数据加载器的状态是正式训练前必须检查的一项。这一步很多人忽略直到训练曲线出现断层才开始后悔。3.5 长文本字段、公式和专业符号怎么处理行业语料经常自带“硬骨头”化学公式、数学式子、PID控制代码、表格、单位换算、流程编号等。如果直接按普通文本处理模型学到的往往是半懂不懂的碎片。我建议用结构化转换把它们统一处理表格转成Markdown或JSON、公式转成LaTeX、代码段保留缩进和注释并在训练序列中加类型标签比如“这段是表格”“这段是代码”。这样做的好处是模型在后面对话时能按类型调用而不是把表格内容当纯文本输出。这里提醒一句做结构化转换时不要过度“美化”。有些转换工具会把表格里的文字和数字强行排版结果模型学到的表格格式和真实的业务表格不一样做推理预测时反而不准。转换的目标是“保留信息结构”不是“做得好看”。4. 评估验收别只盯Loss要盯真实业务表现训练结束不代表任务完成评估往往决定项目能不能上线。但评估CPT效果和评估微调效果有本质区别微调看的是指令遵循和格式稳定性CPT看的是模型是否真的“懂”行业知识。如果只拿几个问答样例看一眼就拍板上线后面早晚出事。4.1 行业评测集怎么建从高频场景反推建议不要等训练完了才开始做评估集而是在数据准备阶段就同步构建。评测集的结构一定要来自业务真实需求先梳理业务里的高频任务场景再为每个场景准备评测样本。比如一个电力设备运维项目高频场景包括故障代码解读、检修报告摘要、设备参数比对、历史故障归因、操作规范问答等。每个场景准备50~100条有标准答案或评估要点的样本总评测集控制在500~1000条足够看出模型的能力画像。评测样本要覆盖三个层次基础概念问答检验术语理解、业务推理题检验知识串联与推理、长文本生成检验报告和文档撰写能力。最后一类样本非常考察CPT的效果因为模型需要把多个知识点组织成连贯的行业文档比单项问答难得多。4.2 通用能力回归测试不能只报喜不报忧CPT评估有个很容易犯的错误就是只看领域任务提升了多少不看通用能力降了多少。我建议任何一次CPT训练都必须跑一轮通用能力回归至少包括常识问答类如C-Eval、数学推理类如GSM8K、代码生成类如HumanEval如果行业语料不含代码可以忽略、指令跟随类如IFEval或内部模板以及格式化输出类如JSON或表格输出。比较基准是训练前的base模型记录每个维度的涨跌幅度。如果发现某个通用维度跌得很厉害先不要慌要看下跌的原因。如果只是数学推理从55分掉到51分但领域评测从30分提到70分这笔交易在很多行业场景中是划算的如果常识问答从60分掉到40分那说明训练配比或学习率出了问题需要回调通用语料比例。评估结果要有量化记录最好做成一份报告方便后续跟业务方对齐预期也方便多轮迭代时对比。4.3 人工评估怎么设计双盲对比和评分卡自动指标只能筛掉明显的烂结果最终用户是否满意还是要靠人工评估。我有一个比较省力的方案从评测集里随机抽50个问题让模型ACPT前基座和模型BCPT后的模型分别回答再把答案随机打乱让业务专家双盲打分。打分维度包括准确性内容是否有事实性错误、完整性是否覆盖问题所有关键点、行业规范性术语、格式、风格是否像行业老手、安全性是否有危险或误导性内容四项每项打1到5分。实测下来CPT后在准确性和完整性上的提升通常最明显行业规范性提升相对慢因为需要更多高质量文档“熏”。如果发现准确性还没提升先检查数据是否存在标注错误或噪音太高的样本再考虑是否训练步数不足。4.4 Loss降了但业务效果没涨可能的原因这个现象很常见遇到别慌按下面的顺序排查首先检查评测集和训练集是否重叠。如果评测样本和训练语料高度相似模型很可能“背答案”真实业务输入一换就露馅。这种情况要把评测集重做保证和训练集互斥。其次检查是否过拟合。训练集PPL和验证集PPL的走势是重要依据。再次看领域数据配比是否足够。如果行业语料只占1%Loss虽然下降但主要由通用语料贡献领域知识自然没涨。最后检查基座模型是否选错。如果拿chat模型做CPT又要面对对话模板干扰知识注入的隐性成本这时效果不明显也在情理之中。5. 从训练到上线推理服务、灰度发布与持续迭代模型训练完只是第一步让它稳定地服务业务才是终点。这个章节讲一讲部署上线阶段要避开的坑以及行业模型后续迭代的机制怎么搭。5.1 推理框架选型vLLM是起步更大规模再考虑SGLang行业模型上线做推理服务首选vLLM这是目前社区最成熟、兼容性最好的推理框架支持PagedAttention、连续批处理、量化推理吞吐量比Transformers原生推理高一个数量级。如果推理并发量极大或者想要更细粒度的调度控制可以再看SGLang或TGI。多卡推理时vLLM的tensor parallel模式支持把模型切到多张GPU上使用方式简单基本能满足大多数场景。一个容易踩的坑是推理框架和训练框架的版本兼容问题。CPT训练用的是Megatron-LM导出的是Megatron格式权重vLLM不一定直接加载需要用权重转换脚本转成Hugging Face格式再加载进vLLM。转换时注意embedding层和lm_head层是否共享权重处理错了模型输出会变成乱码。5.2 上线前的灰度发布和监控指标行业模型上线不能全量切换一定要做灰度。灰度期间重点盯三类指标业务侧的核心KPI比如工单处理时长、问答准确率、审批驳回率、模型侧的服务指标首token延迟、生成时延、GPU利用率、显存占用、质量侧的人工抽检通过率每天抽50~100条线上请求业务专家打分。灰度期间发现问题先切流量回旧模型再分析日志定位原因。这个流程看似保守但能避免很多大事故。监控报警不能只看平均指标要盯分位数。生成耗时只看平均值容易出问题一旦有某条超长请求把显存打爆平均指标才上涨10%但P99已经涨了3倍。建议重点监控P95和P99的耗时以及生成时的最大batch大小前者反映体验后者反映系统风险。5.3 持续迭代的闭环语料回流、定期CPT、基座升级行业模型不是训练一次就完了。业务每天都在产生新数据行业知识库也在持续更新模型必须定期回炉。一个可以落地的迭代流程是每天/每周把线上用户的优质问答、业务系统的新增文档、人工修正过的错误答案统一沉淀到语料库每月做一次增量语料的质量过滤和去重累计到一定量后触发一轮增量CPT或全量CPT每季度到半年把领域模型换到更新的基座上重新走一遍CPTSFT流程避免长时间不升级导致技术债积累。增量CPT有一种做法是“小步快跑”每次只加最近一个月的新增语料学习率调低到1e-5只跑5000~10000步。这样做的好处是单次训练成本低、回归风险小适合业务变化快的行业。缺点是模型不会因为增量训练获得显著的“质变”真正常态化的能力跃升还是要靠大版本迭代。5.4 降本增效量化、蒸馏和模型路由企业上线行业模型成本永远是绕不开的话题。如果业务并发高、响应时延要求严一个72B模型部署成本会很高。我有几个亲测有效的降本手段一是推理量化用AWQ/GPTQ/FP8量化后部署通常能把显存需求降30%~50%生成速度提升20%~40%效果损失一般在可接受范围内。二是小模型蒸馏用大模型72B生成一批高质量标注数据用来训练一个7B或14B的小模型性能可以达到大模型的八成以上性价比极高。三是模型路由简单问题走小模型疑难问题走大模型用一套路由规则或一个轻量分类模型做分发整体成本能降一半。当然降本的前提是不牺牲核心业务效果。建议上线前先做一轮压力测试摸清不同并发下的GPU利用率和时延再决定量化、蒸馏和路由的优先级。6. 从我自己的项目里总结的几条心得文章写到这里该讲的技术要点基本都覆盖了最后聊几句实际做项目时沉淀下来的体会。第一CPT这个技术本身并不神秘它的难点在于工程化和数据治理。很多团队卡在“数据凑不齐、质量上不去、训练不稳定”这三座大山前真正走到上线阶段的反而不多。能把数据管道搭好把训练流程跑稳项目就已经成功了一半。第二不要被“行业大模型”这个概念吓到也不要被它忽悠。大部分行业场景根本不需要从零训练一个模型CPTSFT的组合就已经能把开源模型改造成很能打的行业助手。真正决定项目成败的是你对业务场景的理解深度以及你能不能把领域知识结构化、清洗干净、组织成训练语料。模型架构反而没那么关键。第三训练过程中碰到任何异常先怀疑数据再怀疑代码最后才怀疑模型。这个排查顺序能省很多时间。日志记录一定要详细每一步的参数、数据分布、评估结果都留档方便迭代时对比。这些都是老生常谈但真出事时你会发现它们是救命稻草。最后再分享一个小技巧正式跑全参数CPT之前先用少量数据比如2000万token在单卡或双卡上跑几百步验证整个管线是否通顺确认数据加载、检查点保存、日志输出、评估流程都没问题再上全量算力。这一步看起来“浪费”半天时间实际上能在后面几天的训练里帮你省下一整天的调试时间。祝大家都能顺利把自己手里的通用模型磨成真正懂行业的趁手工具。
返回列表