ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OpenViking 知识蒸馏(Knowledge Distillation)实战指南:将知识库凝练为主题化、可溯源的高层结论

OpenViking 知识蒸馏(Knowledge Distillation)实战指南:将知识库凝练为主题化、可溯源的高层结论 OpenViking 知识蒸馏Knowledge Distillation实战指南将知识库凝练为主题化、可溯源的高层结论【免费下载链接】OpenVikingSelf-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills.项目地址: https://gitcode.com/GitHub_Trending/op/OpenViking本指南以 OpenViking 的ov compile命令与官方示例 Skillknowledge-distillation为核心讲解如何把一个或多个知识库、文档集合蒸馏为主题组织、证据支撑的高层结论——例如跨财务报告的变化与驱动因素多个知识库的横向对比。读者将掌握从资源导入、Skill 安装、编译执行到产物检查的完整 CLI 流程并理解 Skill 内部定义的四级证据标准、主题树输出模型与质量门禁能够直接复现并迁移到自己的业务领域。什么是知识蒸馏OpenViking 的 Context Compilation 概览 将ov compile定义为把散落在文档、笔记、网页、会话记录、研究文件中的原始材料转化为可供人与 Agent 反复复用的结构化知识的过程。知识蒸馏Knowledge Distillation是这一能力的一个专门输出形态Distill一个或多个知识库或文档集合产出跨来源的发现、趋势、变化、驱动因素、对比、影响与不确定性即话题组织、证据支撑的高层知识。它与逐篇文档摘要的本质区别在于蒸馏的产物不是来源的目录或堆叠而是比来源集合更直接地回答用户问题的持久结论。典型使用场景包括蒸馏单个知识库提炼其核心结论横向对比多个集合如两个年度的知识库派生更高阶的洞察例如跨财务报告的变化。输出形状浅层主题树蒸馏的输出是一个浅层的、按主题组织的产物树artifact tree每个主题目录是一个持久的语义领域durable semantic area每个页面是一条独立有用的高层结论。原文档给出了一个形状示例revenue-quality/ growth-shifted-from-volume-to-pricing.md overseas-growth-offset-domestic-slowdown.md profitability/ margin-recovered-but-cash-conversion-weakened.md risk/ customer-concentration-increased.md这只是形状示例——真实的主题与发现由你提供的领域决定。请注意页面命名表达的是结论本身growth-shifted-from-volume-to-pricing而不是来源标题q2-report-summary。这个示例来自官方 Skill 定义 examples/compile/ov-compile-skills/knowledge-distillation/SKILL.md其中明确要求不要把主题目录当作来源容器不镜像知识库名、文档目录、作者、报告期或文件结构除非它们本身就是分析对象默认只使用一层主题目录仅当主题过宽、需要稳定领域边界时才引入子主题跨主题的结论放在最窄的共享主题下或明确命名的横切主题下不要复制进每个相关目录。前置条件在开始蒸馏之前需要满足 Context Compilation 概览 中列出的环境要求运行中的 OpenViking 服务且启用了 Bot--with-bot。默认端点为http://localhost:1933远程使用需要 API Key见 Authentication 指南。尚未启动服务可先参考 Quick StartovCLI 已配置连接~/.openviking/ovcli.conf或OPENVIKING_*环境变量编译任务由 VikingBot 在专用的agent loop中异步执行任务被接受后VikingBot 加载你指定的 Skill、以你的身份读取来源并自主完成阅读—蒸馏—组织—写页面的全过程。你可以等待结果也可以拿到task_id后继续其他工作。VikingBot 的运行时概念详见 VikingBot 概念。Step 1准备来源Prepare the sources蒸馏的输入可以是一个或多个知识库或文档集合。若来源已在 OpenViking 中直接跳过导入若在本地先用ov add-resource导入再用ov ls -r确认ov add-resource ./finance-reports --to viking://resources/finance-reports --wait ov ls -r viking://resources/finance-reportsov add-resource将本地目录./finance-reports导入为资源--wait表示等待导入完成ov ls -r递归列出资源内容用于核对来源是否完整、结构是否符合预期。Step 2安装 SkillAdd the Skillov compile本身不决定编译成什么——输出形状由 Skill 决定同一份来源搭配不同 Skill 会产出完全不同的知识产物。安装官方蒸馏 Skillov add-skill examples/compile/ov-compile-skills/knowledge-distillation --wait ov skills list # → viking://agent/skills/knowledge-distillation (或 viking://user/user_name/skills/knowledge-distillation)ov add-skill从本地路径安装 Skill--wait等待安装完成ov skills list列出已安装 Skill。安装后 Skill 的 URI 通常是全局的viking://agent/skills/knowledge-distillation或按用户隔离的viking://user/user_name/skills/knowledge-distillation。Skill 的元数据name、description定义在 SKILL.md 的 frontmatter 中其description指明了适用边界用户要求蒸馏/综合知识库、对比多个集合、或派生高阶洞察如跨财务报告的变化时使用不用于逐文档摘要。这决定了编译路由时该 Skill 会被何时选中。Step 3运行编译Run compile蒸馏质量的关键在于--reason把分析问题、对比维度、基线、范围完整写清楚它直接设定蒸馏的方向。Skill 会遵循--reason中的分析问题、范围、受众、语言、对比维度与深度否则使用来源的主导语言。单来源蒸馏ov compile \ --from viking://resources/finance-reports \ --to viking://resources/finance-insights \ --skill viking://agent/skills/knowledge-distillation \ --reason Compare the last three years of reports; obtain changes and drivers in revenue quality, profitability, and risk跨知识库对比--from接受多个来源以逗号分隔ov compile \ --from viking://resources/finance-2024,viking://resources/finance-2025 \ --to viking://resources/finance-insights \ --skill viking://agent/skills/knowledge-distillation \ --reason Compare the two yearly knowledge bases; surface changes and structural differences in key metrics从 CLI 源码 crates/ov_cli/src/commands/compile.rs 可以看到--from的底层解析行为按逗号切分、逐项去除首尾空白、自动去重空目录项会报错至少需要一个--from目录解析后的来源列表连同--to、--skill、--reason一起通过client.create_compile(...)提交见 crates/ov_cli/src/client.rs。此外该命令还支持--args传入 JSON 对象形式的附加参数必须为合法 JSON 对象否则报错可用于按需覆盖模型端点等运行时配置——详见同文件的parse_args实现。任务生命周期status 与 cancel命令会立即返回task_id形如cmp_01abcprefix 为cmp_编译在后台异步执行ov task status cmp_01abc # 查看进度与最终结果 ov task cancel cmp_01abc # 协作式取消ov task status id轮询任务进度与结果完整字段参考、任务生命周期与 HTTP API 见 Agent Runtime APIov task cancel id执行协作式取消VikingBot 会在合适的检查点停止。Step 4检查输出Inspect the output先看主题树再深入某个结论页ov tree viking://resources/finance-insights ov read viking://resources/finance-insights/revenue-quality/growth-shifted-from-volume-to-pricing.mdov tree展示产物的主题目录结构ov read读取某个具体结论页的完整 Markdown 内容。关于index.md有两个默认行为需要留意与原文档一致默认不创建index.md——蒸馏本身就是一组结论除非--reason明确要求导航页或现有目标目录存在必须维护的 index 契约重复运行会刷新同一分析页并对任何可能变化的结论做时间限定time-bound而不是静默追加不兼容的新发现。Skill 规范还要求不得手工创建.overview.md/.abstract.md等派生目录摘要文件这些由 OpenViking 自己维护。蒸馏标准四级证据与可审查推理这是知识蒸馏区别于普通摘要的核心。SKILL.md 定义了明确的证据层级页面上的每个主要发现必须落在其中一级证据层级含义标注要求Observation观察来源直接陈述或测量的内容可直接引用Synthesis综合由兼容观察组合而成的模式或对比展示组合逻辑Inference推断来源未直接陈述、经推理得出的结论必须标注为 inference 并解释支撑观察Hypothesis假设现有证据无法确认的合理解释仅在有价值时保留并说明缺失的证据同时必须避免的认知陷阱Skill 原文明确列出把推断当作观察事实陈述把重复出现的说法当作独立佐证同一会议、报告、数据集派生出的多个页面属于同一证据家族不是独立确认把相关性当作因果性把没有证据当作不存在的证据。对于每个主要发现推理必须是**可审查inspectable**的陈述结论 → 引用关键事实 → 说明不明显处的连接 → 必要时注明实践含义或不确定性。避免伪精确的置信度分数仅在有助于读者判断时使用well-supported、mixed evidence、tentative等朴素标签。蒸馏工作流从问题框定到带出处写作SKILL.md 给出了六步方法论每一步都可作为独立的质量控制点框定问题Frame the question先定义主题、时间范围、基线、对比集、预期用途与排除项在深入阅读前拆分独立问题来源很宽时先确认蒸馏要支撑哪些决策或读者需求。先总览再深读Survey before deep reading优先检查每个来源知识库的 index、目录或顶层结构摸清覆盖范围、时间线、权威性、术语、已有摘要与明显缺口不要仅凭文件名或一次搜索命中推断覆盖范围同时追踪来源谱系优先使用一手证据。自底向上构建主题Build topics bottom-up先抽取紧凑的声明卡subject/predicate/scope/time/evidence/status规范化同义主语、去重共享同一上游的声明将相关声明按共同回答的问题或共同解释的机制聚类聚类成簇之后再命名主题避免方便的文件夹分类法把证据强行塞进无支撑的结论。规范化证据Normalize evidence比较前先对齐实体、别名、定义、版本、期间、单位、币种、范围与计量方法变化分析要区分绝对变化、相对变化、结构位移与定义变化——例如声称某项财务指标改善前先对齐报告期、币种、合并范围、指标定义与任何重述。推导并筛选发现Derive and select findings寻找有支撑的变化、反复出现的机制、稳定关系、驱动因素、约束、权衡、异常、风险、机会与知识缺口对每个候选结论用反证与合理解释做压力测试只保留对问题实质、有足够支撑、比直接复述来源更有信息量的结论表格仅用于真正可比的科目或期间派生计算要展示输入值、单位与公式绝不虚构缺失的分母、绝不静默混用报告值与计算值。带出处写作Write with provenance在观察旁放置精确的来源 URI、仓库相对路径或提供的链接链接要有简短可读文本并保留锚点绝不发明来源、锚点、引文、日期、指标、关系或因果解释声明级证据保持内联若页面需要来源清单则只在## Sources下渲染一次说明来源覆盖范围与重要遗漏让读者知道蒸馏能证明什么、不能证明什么。集成既有知识蒸馏不是每次都从零开始。Skill 要求更新前先总览现有主题树并完整阅读相关蒸馏页保留准确的独特上下文与用户原创内容合并互补证据刷新同一分析页而不是创建同义主题或重复结论对可能变化的结论做时间限定当新证据改变旧结论时解释过渡及其证据除非任务要求否则不动无关目标页与可选 index。输出页面格式与质量门禁每个新建的蒸馏页面都是完整的 OKF Markdown 文件frontmatter 必须包含--- type: distillation title: Canonical analytical title description: One factual sentence stating the question, scope, and retrieval purpose. ---frontmatter 之后是匹配的 H1 标题以及一段 24 句的直接回答正文只使用分析所需的小节如 scope and evidence、key findings、changes and drivers、comparisons、implications、uncertainties宁要少量实质发现不要大量浅层观察。页面标题应表达结论而非summary、report或来源标题例如用revenue-quality/growth-shifted-from-volume-to-pricing.md而非finance/q2-report-summary.md。Skill 定义的最终质量门禁Quality gate要求逐项核验开头是否直接回答清晰的分析问题或定义有用的领域概览结果是否跨知识综合而非逐个来源总结每个主要发现是否有从引用观察到结论的可追踪链条观察/综合/推断/假设/来源观点是否可区分期间、实体、定义、版本、单位、币种、范围在比较处是否可比反证、矛盾、来源依赖、覆盖缺口与不确定性是否保留因果声明不超出证据主题目录反映分析领域而非来源布局且保持浅层每页只含一条独立有用的高层知识单元未在无要求时创建根 index每个文件都有非空的type/title/descriptionfrontmatter不创建 OpenViking 生成的语义 sidecar、逐来源摘要页或重复操作日志。相关文档Context Compilation 概览 ——ov compile的整体机制、参数语义与 Skill 对照表Daily Report 示例 —— 同框架下的另一种输出形态按日报告Agent Runtime API —— 创建、查看、取消编译任务的完整字段参考与 HTTP APIVikingBot 概念 —— 驱动编译的异步 Agent 运行时Skills API —— Skill 的管理与自定义Skill 源文件examples/compile/ov-compile-skills/knowledge-distillation/SKILL.mdCLI 实现crates/ov_cli/src/commands/compile.rs【免费下载链接】OpenVikingSelf-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills.项目地址: https://gitcode.com/GitHub_Trending/op/OpenViking创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表