ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何从一本书中的蒸馏知识?

如何从一本书中的蒸馏知识? 目录1.什么是蒸馏2.什么是书籍知识蒸馏3.蒸馏最核心的三个动作4.参考Chatgpt给出的工作流程从一本书中蒸馏知识1知识提取2 知识理解3去冗余蒸馏中最关键的一步4概念抽象概念归并5关系重构形成知识图谱6形成“最小但完整”的知识体系这是整个流程最接近真正蒸馏的地方。7建立一个“蒸馏评分”从完整流程中可以就看出LLM模型贯穿全程那么简单概括LLM模型在其中的作用1.什么是蒸馏就是“把复杂对象里的核心信息提取出来变成更精简、更容易使用的形式同时尽量保留原来的有效信息”。2.什么是书籍知识蒸馏简单地说就是将原来几十页的描述蒸馏成一个结构化知识单元。以一本机械零件加工手册为例500页原始手册↓提取核心知识↓去掉重复和无关信息↓重新组织知识关系↓得到几十页/几百个知识单元类比知识蒸馏KD简单地说一本书就是教师模型书中的全部知识就i是教师模型的知识书中的知识库/学习笔记就是学生模型对问题的回答概念之间的关联就是逻辑书中的概念事实原理就是特征对蒸馏结果的质量约束就是KD Loss从书中学习的核心知识就是学生模型学习的东西。Teacher 原书Student 蒸馏后的知识表示注意的是只是简单的类比其中的数学逻辑不能做套用。同时在目标上也有所差别模型的知识蒸馏为了模型压缩/能力迁移书记知识蒸馏为了知识压缩/知识结构化/知识保留3.蒸馏最核心的三个动作1提取找出“有什么知识”2压缩删除重复、冗余的信息3保真最重要不能为了压缩而减少内容或以偏概全对于机械加工项目来说不是简单地将机械加工手册总结下而是从机械加工手册的文本、图片和表格中提取核心加工知识并在压缩知识规模的同时保持知识之间的语义、几何和工艺关系。其中真正值得研究的核心其实是“如何在减少知识量的情况下最大程度地保持原始机械加工知识的正确性和关系结构”这才是“蒸馏”最核心的思想。4.参考Chatgpt给出的工作流程从一本书中蒸馏知识以零件加工手册为例机械加工手册│↓① 知识提取│ LLM OCR VLM 表格解析↓② 知识理解│ LLM Embedding 知识分类↓③ 去冗余│ Embedding 聚类 相似度 LLM判断↓④ 概念抽象│ LLM Ontology 层次聚类↓⑤ 关系重构│ Knowledge Graph LLM Graph算法↓⑥ 最小但完整的知识体系│ 图优化 知识压缩 完整性验证↓精炼机械加工知识库详细讲解如下1知识提取目标把原始文档转换成结构化知识单元。a. 文本提取需要处理文字图片表格公式图注标题章节页码技术PyMuPDF/PaddleOCR区别扫描版的PDF图片需要用OCR提取文本电子版的PDF直接提取文本即可最好同时保存文本内容页码坐标bbox字体/标题i信息b. 图片提取技术流程PDF - Image Extraction - 图片 -VLM- 图片语义c. 表格提取目标为后面做参数知识抽取做准备技术流程 Table Detection - Table Structure Recognition - Structured Datad. 得到“原始知识单元”Knowledge Unit2 知识理解就是要理解文本中的含义。----是什么为什么怎么做有什么作用等技术支持LLM Structured OutputEmbedding的作用LLM负责理解语言。Embedding负责把知识转成向量通过向量相似度判断文本之间的相关性。常用技术BGE / E5 / Qwen Embedding / OpenAI Embedding那么文本和图片怎么对齐确定“哪一段文字”描述“哪一张图片”以及这段文字和图片中“哪个机械特征”对应。图文对齐应该放在“知识理解”和“去冗余”之前。回答通常要结合版面位置 图注 章节结构 语义相似度 VLM理解。第一步给文字和图片都建立“位置”解析PDF的页码为当前页的每个对象都保存坐标第二步利用空间距离进行第一次匹配利用坐标进行匹配距离越近初始关联概率越高有个Bug要注意当有两张图横向排版时就i不能只用距离完成需要图注匹配第三步利用图注进行对齐图注中的文字和文本中的文字进行相似度匹配第四步利用章节结构构建强关联第五步语义对齐——Embedding解决图片没有文字说明的情况需要让模型理解这张图表达的是什么----------先用VLM对图片生成描述然后分别通过Text Embedding和Image Description Embedding得到特征向量再计算余弦相似度。第六步VLM直接进行图文判断——“这张图片是否表达了这段文字”最后将所有信息综合起来进一步可以按照以下方向改进采用四级对齐第1级版面对齐Text ↔ Image↓“它们在页面上是不是相关”第2级语义对齐Text ↔ Image↓“它们表达的是不是同一个主题”第3级知识对齐Concept ↔ Concept↓“文字中的‘深槽’是不是图片中的‘深槽’”第4级区域对齐Text Concept ↔ Image Region↓“文字中的‘刀具’具体对应图片中的哪个区域”3去冗余蒸馏中最关键的一步常见技术路线可以使用K-Means / Cosine Similarity / DBSCANKnowledge↓Embedding↓Similarity Matrix↓Clustering聚类把“相似的东西”自动分到同一组不需要提前告诉计算机每一组叫什么。↓LLM判断↓合并语义相似 ≠ 知识相同所以不能只用Embedding4概念抽象概念归并技术支持 Embedding LLM Ontology Clustering用Embedding找相似的概念用LLM判断概念之间的关系Ontology本体是什么是一个带有明确语义关系的知识网络。是“概念抽象”和“关系重构”的骨架。在现在这个“机械加工手册知识蒸馏”的语境里可以简单理解为把一个领域里“有哪些概念、概念是什么、概念之间是什么关系”规定清楚的一套知识体系。Ontology 和 Knowledge Graph 又是什么关系Ontology 规定“知识应该怎么组织”。Knowledge Graph 根据这个规定把实际知识装进去。彻底理解Embedding、Clustering、Ontology、Knowledge Graph原始机械手册│↓知识提取│↓Embedding│“转换成向量”↓Clustering│“相似的放一起”↓概念抽象│“这些是什么”↓Ontology│“概念和关系怎么定义”↓Knowledge Graph│“实际知识放进去”↓知识蒸馏5关系重构形成知识图谱关系抽取的方法LLM 规则Neo4j 图算法Graph Transformer/GNN图算法的作用Neo4j存放的就是图用图算法可以学习哪些知识节点之间的关系更重要。6形成“最小但完整”的知识体系这是整个流程最接近真正蒸馏的地方。目标尽可能少的知识单元覆盖尽可能多的重要知识。图优化知识压缩检查正确性完整性关系完整性可追溯性7建立一个“蒸馏评分”C Coverage 知识覆盖率R Relation Preservation 关系保留率F Factuality 知识正确性Red Redundancy 冗余率从完整流程中可以就看出LLM模型贯穿全程那么简单概括LLM模型在其中的作用LLM 不应该负责所有事情。最合理的架构是传统工具负责“看、测、算、检索”LLM负责“理解、判断、抽象、推理、生成结构化知识”。可以把 LLM 看成整个系统里的一个知识理解与推理中枢。但是整个过程不能只有LLM否则会产生幻觉。完整流程可以扩展为机械加工手册│↓┌──────────────┐│ 文档解析 │└──────────────┘│┌────────┼────────┐↓ ↓ ↓文本 图片 表格│ │ │OCR VLM Table Parser│ │ │└────────┼────────┘↓多模态知识提取│↓┌──────────┐│ LLM │ ← 理解└──────────┘│↓Embedding│↓Clustering│↓┌──────────┐│ LLM │ ← 去重判断└──────────┘│↓概念抽象│↓┌──────────┐│ LLM │ ← 概念归纳└──────────┘│↓Ontology│↓┌──────────┐│ LLM │ ← 关系抽取└──────────┘│↓Knowledge Graph│↓知识压缩/蒸馏│↓最小完整知识体系第一阶段LLM理解理解文本理解图片VLM 是 LLM 在视觉上的扩展。第二阶段负责图文对齐第三阶段负责去冗余第四阶段负责概念抽象第五阶段LLM负责构建 Ontology第六阶段LLM负责关系抽取第七阶段LLM负责知识压缩结合上述分析的缺陷最好的架构其实是“LLM 专用模型 算法”整个系统可以理解为三个“大脑”机械加工手册│↓┌──────────────────┐│ 数据处理层 ││ OCR/VLM/Parser │└──────────────────┘│↓┌──────────────────┐│ LLM层 ││ ││ 理解 ││ 抽象 ││ 推理 ││ 对齐 ││ 去冗余 ││ 关系抽取 │└──────────────────┘│↓┌──────────────────┐│ 知识约束层 ││ Ontology ││ Rules ││ Validation │└──────────────────┘│↓Knowledge Graph│↓知识蒸馏结果
返回列表