ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

面试知识题

面试知识题 问题答案类型transformer中的attention结构用户语句query经过三个矩阵三次运算得到QKV计算公式Q与K倒置进行点积运算在使用softmax得到每个词权重占比因为softmax的缩放能力所以Q与K倒置除以K维度数的开方缓解此等现象。再与V进行点积得到序列中每个位置对所有其他位置的注意力权重从而动态聚合上下文信息大模型原理transformer中的attention结构中为什么要除以K维度数的开方在使用softmax得到每个词权重占比因为softmax的缩放能力所以Q与K倒置除以K维度数的开方缓解此等现象。大模型原理transformer中的模型架构输入经过embedding层位置embedding层Encode为attention FFN中间用残差加归一化维持数据分布不混乱。Decode为attention 交叉注意力Cross-Attention FFN 中间用残差加归一化维持数据分布不混乱。大模型原理残差的作用是什么通过跳过子层的恒等映射缓解深层网络的梯度消失问题使梯度能直接回传到浅层保证深层模型可训练。大模型原理层归一化layer normalization再经过每层之后输入向量的分布会随之发生变化当层数升高之后会引发输入向量的分布完全偏离导致训练效果下降归一化在每层之后将输入向量归一化到相同数据分布之下大模型原理tokenizer有哪些主流方案字节级BPE放弃字符直接在最底层的字节Byte上做文章。再按频率合并高频相邻子词绝对安全永远不会遇到不认识的字任何语言、代码符号、特殊表情都能被编码。效率极高对于英文等拉丁语系高频词如 the, ing会被合并成一个 Token大大缩短了文本长度提升了计算速度。大模型原理SentencePiece把空格也当成一个普通的字符把整句话当成一条连续的字符流来处理。“我爱 Python”处理为“我 爱 ▁ P y t h o n”经过训练后得到“我”“爱”“_python”好处1.多语言极其友好它不需要预先判断哪里是词边界中文、日文、英文、阿拉伯文全部一视同仁统一当成字符流来切分完美解决了无空格语言的预处理难题。2.自带“防呆”机制它支持一种叫“字节回退Byte Fallback”的功能。如果某个生僻字在训练时真的没被收录进词表它会自动退化成字节级别来表示避免了 [UNK] 的出现。交叉注意力与自注意力有什么不同自注意力的 Q、K、V 来自同一序列交叉注意力的 Q 来自一个序列如 DecoderK、V 来自另一个序列如 Encoder 输出用于跨序列信息融合。注意力多头注意力为什么要分多个头单头注意力容易更关注于词本身分多个头是为了让模型在不同的子空间中并行关注不同类型的维度信息高维信息可以类比语义信息成语法指代长举例依赖最终拼接融合以获得更丰富的表示。注意力位置编码的作用与泪悲attention计算是矩阵计算对位置不敏感更换词的位置得到的注意力矩阵数值是相同必须增加位置编码可以增加位置信息。位置编码正弦位置编码是固定的绝对位置编码作用于输入阶段RoPE是旋转位置编码通过旋转 Q/K 向量实现相对位置建模可以外推性适应更长的输入长度作用于attention中的Q K点积时MHA多头注意力将原本的Q分成8等份就是8头注意力只要是分成等份的做法都是多头注意力注意力MQA多查询注意力所有 Query 头共享同一组 K 和 VKV 头数 1注意力GAQ分组查询注意力把 Query 头分成 G 组每组共享一组 K/VKV 头数 G注意力MLA多头潜在注意力不砍头数而是把 K/V 低秩压缩到一个低维潜向量再缓存也就是原本的KV进行矩阵运算降维将维度变小形成小的KV进行注意力计算节省运算消耗。运算完再矩阵升维回去这样从一个attention模块看起来就是无感的单计算量下降了KV cache也下降了注意力MoBA混合块注意力将长上下文切成多个固定长度的块每个 Query 通过门控网络动态选择最相关的 top-k 个块做注意力跳过无关块也就是只看一句话中最相关的几段其他都不进行注意力计算缩短长度节省资源注意力vllm是什么KV cachepage attention是vllm的主要思路大模型推理KV cache自回归生成时缓存历史 token 已计算好的 K、V 向量每步只需计算新 token 的 Q/K/V 并与缓存拼接做注意力避免重复计算将每步计算从 O(n²) 降为 O(n)。KV cache的原理自回归生成时缓存历史 token 已计算好的 K、V 向量每步只需计算新 token 的 Q/K/V 并与缓存拼接做注意力避免重复计算将每步计算从 O(n²) 降为 O(n)。大模型推理page attention的原理存储KV cache的时候如果使用连续存储空间会造成显存碎片化预先分配的上限可能极大但实际生成的很短造成显存浪费。PagedAttention 将连续的 KV Sequence 切分成大小固定的块Block例如每个 Block 存放 16 个 Token用虚拟地址存储这样在逻辑上KV 是连续的但是存储是碎片化存储。这样就不会出现显存浪费提高显存利用率大模型推理自回归语言模型预测下一个 tokenNext Token Prediction即给定前文预测当前词训练模型接龙能力。典型是就是GPT、deepseek大模型原理掩码语言模型随机遮盖输入中的部分 tokenMLM让模型根据上下文预测被遮盖的词训练双向理解能力。大模型原理大模型的训练过程预训练阶段数据通常来自网页爬取Common Crawl、书籍、代码仓库、学术论文等通过语言过滤、去重MinHash、启发式规则去除低质量/重复/有害内容和质量打分模型进行筛选。训练目的按词不断输入预测下一个词类比大量的知识阅读大模型训练SFTSupervised Fine-Tuning阶段数据人工标注的指令-回答数据训练目的输入指令预期得到回答相似结果让模型从只会续写变为能按指令回答问题获得指令遵循、对话和安全拒答能力。RLHF强化学习奖励模型Reward Model使用人类偏好数据一个回答多个回复其中一个回复是最好的回复奖励模型可以给最好的回复打最高的分数训练一个奖励模型。PPO算法GRPO算法优化训练模型PPO算法要训练的模型W奖励模型RW复制成actorreference两个模型reference冻结R复制成rewardcritic两个模型critic冻结大模型训练1.输入q-actor结果a结果a每个token的概率矩阵old_logprob2.输入q结果a-rewardrm_score此回答的分数3.输入q结果a-referenceref_logprob更换冻结模型再次判断回答a中每个token的概率矩阵4.ref_logprob-old_logprobKL防止生成的回答过于偏离平均水平毕竟大模型是概率两次token概率不能偏离太大5.rm_score-beta*KLfinal_reward。Beta是个超参数使用KL约束奖励分数6.输入q-criticcritic_value于reference相同逻辑二次验证奖励分数避免奖励模型因为概率偏离平均水平7.final_reward-critic_valueadvantage。优势的正与否表明此回答比预期好还是不好只是预期8.输入q结果a-actornew_logprob。actor再次给出每个token的概率矩阵9.exp(new_logprob-old_logprob)ratio采样比ratio还会经过裁剪不让其太大太小控制在【0.81.2】中10.-ratio*advantageloss更新actorrewardGRPO算法于PPO的区别是去掉了criticfinal_reward采用多个qa的rm_score进行归一化得到final_reward第六步第七步不同大模型训练1.输入q-actor结果a结果a每个token的概率矩阵old_logprob2.输入q结果a-rewardrm_score此回答的分数3.输入q结果a-referenceref_logprob更换冻结模型再次判断回答a中每个token的概率矩阵4.ref_logprob-old_logprobKL防止生成的回答过于偏离平均水平毕竟大模型是概率两次token概率不能偏离太大5.rm_score-beta*KLfinal_reward。Beta是个超参数使用KL约束奖励分数6.多个rm_score得平均值rm_mean得标准差rm_std7.(final_reward-rm_mean)/rm_stdadvantage。优势的正与否表明此回答比预期好还是不好只是预期8.输入q结果a-actornew_logprob。actor再次给出每个token的概率矩阵9.exp(new_logprob-old_logprob)ratio采样比ratio还会经过裁剪不让其太大太小控制在【0.81.2】中10.-ratio*advantageloss更新actorrewardLoRA的原理是什么与MLA思想相同模型权重W2是个低秩矩阵可以通过矩阵变换A(d*r)*B(r*d)W2(d*d)WW2W1W1就相当于训练之后的模型参数用极少的可训练参数0.1%-5%即可达到接近全量微调的效果。这里明确是接近不是超越和等于大模型训练温度值是如何生效softmaxlogit / temperature节概率分布的“尖锐/平坦”程度来控制生成随机性。大模型推理向量的原理将文本通过 Embedding 模型映射为高维向量通过余弦相似度或内积衡量语义相似性训练通常采用对比学习如 InfoNCE 损失拉近正样本对、推远负样本对。向量scaling law描述了模型性能损失与模型参数量 N、训练数据量 D、计算量 C 之间的幂律关系三者越大性能越好但收益递减。因为 Scaling Law 表明性能随规模幂律提升但收益递减且受数据质量和多样性限制当数据耗尽或模型容量远超任务需求时继续扩大规模收益趋近于零。大模型训练涌现涌现能力指模型在规模超过某个阈值后突然出现的新能力如思维链推理小模型因参数和表示容量不足无法形成复杂推理链路规模增大后网络容量足够才解锁。大模型应用幻觉模型生成看似合理但事实错误的内容原因包括训练数据噪声、知识记忆偏差、过度自信等缓解方法包括 RAG 引入外部知识、RLHF 对齐、自我一致性验证等。大模型应用RAG流程离线阶段知识整理分块→Embedding 向量化→存入向量数据库、知识图谱等在线阶段用户查询向量化→向量数据库召回 Top-K 相关片段→可选重排序rerank阶段→拼接为增强 Prompt→LLM 生成回答。大模型应用Harness与Loop期望让Agent做到自迭代人只作为检察官。制定迭代总目标例如测试集效果提升。每轮迭代中LLM会自己制定本次的迭代目标迭代链路思路硬性要求。历史人工的迭代记录供参考迭代红线是什么不会细到每一步应该怎么做这些是LLM根据当时环境自己生成只做框架设置停止迭代条件。全局红线例如token消耗量迭代轮次迭代效果不断下降等等验证数据集。判断每轮迭代的效果大模型应用PS历史人工的迭代记录中记录人在迭代时是如何列迭代计划如何收集数据如何定义问题如何设计解决方案如何实现并验证目前存在的常见问题可以归类到幻觉问题。历史某一轮迭代中幻想出了一个条件信息后续迭代因为上下文导致认为此轮幻想出的信息是一个真实信息导致后续所有迭代全部跑偏。
返回列表