
1、大模型温度系数在长文本生成模型中采用温度系数Temperature动态递增策略从 T0.4T0.4 逐渐升至 T0.8T0.8 是一种旨在平衡“局部连贯性”与“全局多样性”的高级解码技巧。这种策略的核心逻辑在于让模型在开头保持严谨和确定随着文本展开逐渐释放创造力和发散性。以下是对该策略的深度解析、数学实现及工程注意事项为什么要这样做设计动机生成阶段温度设定目的与作用解决的问题起始阶段T≈0.4T≈0.4高确定性、强约束。确保Prompt的续写紧密贴合指令语法正确逻辑锚点稳固。防止开篇跑题、幻觉或格式错误建立稳定的上下文基调。过渡阶段0.4→0.80.4→0.8平滑过渡。避免风格突变导致的文本割裂感。防止因温度跳变引起的语义断层或语气不一致。后半程T≈0.8T≈0.8增加熵值、提升多样性。引入更丰富的词汇和句式避免长文陷入重复循环。解决长文本生成中常见的“退化”问题Repetition Degeneration和内容枯燥。在长文本生成中将温度系数恒定保持在 T0.8T0.8是一种与动态升温策略截然不同的设计哲学。其核心目标是在整个生成过程中维持恒定的随机性水平即熵值稳定确保模型在任何位置的“探索-利用”权衡保持一致。以下是对该策略的深度解析、适用场景及工程要点为什么选择恒定 T0.8特性恒定 T0.8动态升温 (0.4→0.8)概率分布形态全程一致softmax输出的熵不变从尖锐到平坦熵递增风格一致性✅ 全文语气、创造力水平均匀⚠️ 前稳后放可能存在风格断层开篇稳定性⚠️ 相对较弱依赖Prompt质量✅ 强约束锚定效果好长文抗退化✅ 持续抑制重复模式✅ 后期才发力抑制可预测性✅ 行为均匀调试简单⚠️ 需额外调参调度曲线计算开销✅ 零额外开销✅ 几乎零开销2、为什么现在的大模型都是Decoder-only架构参考 https://www.zhihu.com/question/588325646/answer/33572526123、强化学习框架PPO、DPO、GRPO等基本原理介绍https://zhuanlan.zhihu.com/p/19843870736255930893.1、PPOPPO使用clipping机制的原因clip 函数的核心作用是截断。它将新旧策略的概率比率r强制限制在[1−ϵ,1ϵ] 这个区间内。这意味着我们只允许模型在旧策略的基础上进行小步调整防止模型因为一次性更新幅度过大步子迈太大而导致训练崩溃扯着蛋从而保证了强化学习过程的稳定性。4、梯度消失与梯度爆炸参考https://zhuanlan.zhihu.com/p/153915702145、最大似然估计参考https://zhuanlan.zhihu.com/p/32341102考题二项分布的最大似然估计6、Transformer参考https://zhuanlan.zhihu.com/p/18887142109402855251缩放点积为什么要除以根号dk7、SFT参考https://zhuanlan.zhihu.com/p/20064044760561426871SFT出现过渡道歉现象的原因SFT监督微调后模型出现“过度道歉”现象最可能的原因是训练数据中对齐语料的安全/拒绝回复模板高度同质化导致模型将“礼貌性致歉”与“安全合规响应”形成了过强的统计绑定。这本质上是一个数据分布偏差问题而非模型架构或训练算法的缺陷。以下是分层归因分析核心原因对齐数据的模板污染在RLHF/SFT的对齐阶段标注者或合成数据生成管线通常使用固定模板处理敏感/边界请求❌ 很抱歉我无法回答这个问题。作为AI助手我...❌ 对不起我不能提供此类信息...❌ I apologize, but I cannot...当这类模板在训练集中占比过高且变体极少时模型会学到两个错误的启发式任何不确定性 → 触发道歉前缀即使问题完全无害任何用户负面反馈/纠正 → 触发道歉而非直接修正答案次要放大因素因素机制严重程度DPO/RLHF奖励模型偏差奖励模型本身偏好礼貌但无用的回复胜过直接但有风险的回复强化学习进一步放大了道歉倾向⭐⭐⭐⭐SFT数据去重不足同一安全模板被重复采样数千次远超正常对话中道歉的自然频率⭐⭐⭐⭐负样本缺失训练集中缺乏无需道歉的正常拒绝和被纠正后直接修正的正例⭐⭐⭐Base模型预训练偏差预训练语料中客服/论坛道歉文本比例偏高SFT未充分覆盖⭐⭐Loss权重均匀安全回复与普通回复使用相同loss权重高频模板主导梯度方向⭐⭐8、贝叶斯网络参考https://zhuanlan.zhihu.com/p/5738833371给定父节点的条件下每个节点与其非后代节点条件独立但后代节点在被观测到的前提下仍可作为证据影响该节点9、KV Cache参考https://zhuanlan.zhihu.com/p/1896199264121644180参考https://zhuanlan.zhihu.com/p/6858535161计算复杂度阶段 / 指标无 KV 缓存 (1)有 KV 缓存 (2)单步 Token 计算量O(t²)O(t)完整生成总计算复杂度O(n³)O(n²)显存空间复杂度内存开销O(1)不存历史O(n)随序列线性增长2KV缓存大小设输入序列的长度为 s 输出序列的长度为 n 模型深度为l维度为h,以 FP16 来保存KV cache那么KV cache的峰值显存占用大小为 b(sn)h∗l∗2∗24blh(sn) 。这里第一个2表示K/V cache第二个2表示 FP16 占2个bytes。以 GPT3 (175B) 为例对比 KV cache 与模型参数占用显存的大小。GPT3 模型weight占用显存大小为350GB (FP16)层数 l为96维度h为12888。batch sizesnKV cache(GB)KV cache/weight4409675.50.221640963020.8664409612083.4510、机器学习管道Machine Learning Pipeline10.1、Lasso回归参考https://zhuanlan.zhihu.com/p/88698511通过正则化实现泛华10.2、PCA参考https://www.zhihu.com/question/40956812降维前必须进行标准化PCA不进行缩放仅进行旋转10.3、Permutation Importance参考https://zhuanlan.zhihu.com/p/563422607对相关性高的变量会低估重要性模型默认的Feature Importance同样存在该问题10.4、特征哈希参考https://zhuanlan.zhihu.com/p/504100961特征哈希Feature Hashing / Hashing Trick:特征哈希是AI设计模式中的一种数据表示模式能够有效解决分类数据不完整、高基数特征类别不均、以及冷启动问题推理时无法处理新出现的类别11、大模型量化11.1、量化影响因素参考https://zhuanlan.zhihu.com/p/202592499463122167712、Prefill和Decode参考https://zhuanlan.zhihu.com/p/20200904800089303431Prefill和Decode为什么不能放到一起https://zhuanlan.zhihu.com/p/2063134827772130211Prefill 负责一次性处理完整 prompt更依赖 GPU compute主要影响 TTFT。Decode 负责逐 token 生成答案需要频繁读取 KV cache更依赖 memory bandwidth主要影响 TPOT。如果两者一直运行在同一组 GPU 上长 prompt 的 Prefill 很容易干扰正在进行的 Decode导致 latency spike、GPU utilization 不稳定以及 TTFT 和 TPOT 很难同时优化。13、多头注意力机制13.1、基本原理参考深度学习之MHA|MQA|GQA|MLA注意力机制对比分析-腾讯云开发者社区-腾讯云考题注意力机制的主要作用是什么自注意力通过 O(1)O(1) 路径长度直接连接任意位置使全局上下文交互成为可能每个输出 token 都是所有输入 token 的加权组合权重由内容动态决定可以建模序列元素之间的长距离依赖。13.2、多头注意力机制计算量参考LLM注意力机制计算量分析 https://zhuanlan.zhihu.com/p/1948538300169172299MHA的原理和参数量计算 第8讲、Multi-Head Attention 的核心机制与实现细节 - 何双新 - 博客园A. 并非所有注意力变体都需计算 QKTQKT✅标准Attention确实需要计算 QKTQKT 复杂度 O(N2)O(N2) 但线性注意力Linear Attention如Performer、RWKV、Mamba等通过核技巧或状态空间模型将注意力转化为线性递推形式完全避免了显式的 QKTQKT 矩阵乘法。因此“并非所有”这一表述是正确的。B. MHA的参数量可能不随头数线性增长❌在标准MHA中当总维度 dmodeldmodel 固定时无论头数 hh 如何变化 WQ,WK,WVWQ,WK,WV 的总参数量恒为 3×dmodel23×dmodel2 与头数完全无关即参数量恒定而非“可能不线性增长”。该选项表述模糊且易误导不属于准确描述。若改变总维度则另当别论但这已超出MHA标准定义范畴。C. MLA的训练速度通常快于MHA❌MLAMulti-head Latent Attention的核心设计目标是推理时压缩KV Cache其训练过程涉及联合压缩/解压及额外的投影操作计算开销通常不低于甚至略高于标准MHA。MLA并未以训练加速为主要优化方向该表述错误。D. GQA在推理时可减少K/V缓存的内存占用✅GQAGrouped Query Attention让多个Query头共享同一组Key/Value头使推理时KV Cache大小降为MHA的 1/G1/G GG 为每组Q头数显著降低显存占用同时保持接近MHA的性能。这是GQA被Llama-3、Qwen2等主流模型采用的核心原因表述准确无误。14、截断误差和舍入误差参考https://www.zhihu.com/question/392307362截断误差Truncation error是最为重要的误差会出现在微分方程的求解、数值积分、数值微分等方方面面。所谓的“截断”即是指在将物理量进行离散处理时抛弃了高阶项。一般使用阶数来描述离散方法的精度。收敛误差一般出现在使用迭代方法求解问题时由于未能完全收敛而引入的误差实际上也不可能实现真正意义上的收敛例如用高斯赛德尔迭代求解线性方程组、牛顿方法求解非线性方程组、幂迭代求解最大本征值、使用Picard迭代求解大型的非线性物理场耦合问题等。舍入误差由有限位数的浮点数来表示实数的时引入。具体大小与浮点数类型相关舍入误差常从Random walk的角度对其进行量化。随机方法中的误差是指使用基于概率论的方法来求解问题时引入的“误差”例如使用蒙特卡罗方法估计面积、模拟粒子的random walk。在粒子蒙卡模拟领域随机方法中的误差更严谨地来说可以分为系统误差与统计偏差。后者是我们常见的方差即投入模拟的粒子数不足时引入的随机波动而前者则是由于粒子数不足导致无法对复杂的几何和物理量进行准确描述而引入的误差。15、分词算法15.1、分词算法基本原理现代大语言模型LLM子词分词算法字节对编码BPE从基础字符或字节出发统计语料中最高频的相邻对并不断合并直到达到设定的词表大小。如 GPT 系列、Llama 均采用此法。 [1]WordPiece与 BPE 类似但合并标准基于语言模型的似然得分最大化而非单纯频率如 BERT 使用带有##前缀的 WordPiece。 [1]Unigram采用“自顶向下裁剪”策略从一个超大词汇表开始逐步删除对整体似然影响最小的词元。 [1]SentencePiece谷歌推出的无损分词库直接将空格视为特殊字符处理对中文、英文等多语言无缝支持。参考1BPE分词算法 NLP-分词算法一Byte-Pair Encoding (BPE) / Byte-level BPE【BPE是char级别】_bpe算法-CSDN博客2WordPiece分词算法【大模型实战篇】大模型分词算法WordPiece分词及代码示例-CSDN博客15.2、BPE和WordPiece分词算法对比考点下面哪些说法是正确的A. 在BPE中每轮迭代总是合并出现频次最高的符号对正确这是 BPE 算法的核心机制。BPE 从字符级词表开始统计所有相邻符号对的出现频率贪心地选择频次最高的符号对进行合并并将该合并操作加入规则列表然后更新语料中的符号序列重复此过程直到达到预设词表大小或满足停止条件。因此“每轮合并频次最高符号对”是 BPE 的定义性特征。B. WordPiece在每次合并时基于语言模型最大化似然而非简单频次正确WordPiece 与 BPE 的关键区别在于合并准则。WordPiece 并不直接选择频次最高的符号对而是选择使训练数据语言模型似然增加最大等价于 perplexity 下降最多的符号对进行合并。C. 两者都会把罕见词切分为更频繁的子词单元正确这是子词分词的共同设计目标。无论是 BPE 还是 WordPiece都通过自底向上的合并策略将高频子词保留在词表中而低频词或未见词则被分解为这些高频子词的组合。例如“unhappiness”可能被切分为 “un”, “happi”, “ness”每个子词都比原词更常见。这种机制有效缓解了未登录词问题并平衡了词表大小与语义表达能力。❌ 错误选项解析D. 如果使用相同语料训练BPE与WordPiece最终得到的词表一定完全相同错误尽管两者输入相同但由于合并准则不同频次 vs. 似然增益它们在每一步选择的合并对可能不同导致后续符号序列演化路径分歧最终词表通常不一致。大量实证研究如 Hugging Face Tokenizers 文档、相关论文已证实即使词表大小相同BPE 和 WordPiece 生成的词表存在显著差异。此外实现细节如预处理、Unicode 处理、初始词表等也会进一步加剧差异。16、因果编码基础原理参考一步一步理解大模型因果掩码_causal mask-CSDN博客掩码矩阵的构建https://zhuanlan.zhihu.com/p/16961969131GPT的训练方法是使用因果掩码causal mask让模型在预测当前令牌时不能看到未来的令牌