ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

graphify置信度标签完全指南:EXTRACTED、INFERRED、AMBIGUOUS如何区分事实与猜测

graphify置信度标签完全指南:EXTRACTED、INFERRED、AMBIGUOUS如何区分事实与猜测 graphify置信度标签完全指南EXTRACTED、INFERRED、AMBIGUOUS如何区分事实与猜测【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphifygraphify 是一个把代码库、文档、SQL 配置和 PDF 变成可查询知识图谱的开源工具为 Claude Code、Cursor、Codex、Gemini CLI 等 Agent 提供本地确定性 AST 解析能力。它给图谱中每一条边都打上 EXTRACTED、INFERRED、AMBIGUOUS 三种置信度标签明确区分代码里白纸黑字的事实与模型推测的猜测。本文带你一次看懂这三个标签的判定规则、打分细则和实际查看方法。为什么知识图谱需要置信度标签graphify 的边来自两个来源AST 确定性解析import、函数调用、类包含等结构关系直接由本地解析器从源码提取结果可复现、零猜测语义提取文档、论文、图片中的概念关系共享数据结构、隐含依赖、引用需要 LLM 理解天然带有不确定性。如果不加区分查询结果里确定如此和可能是这样会混在一起结论就不可信。所以 graphify 在 schema 层面强制规定每条边必须带confidence字段且只能是三个合法值之一非法值会在 graphify/validate.py 的校验阶段直接被拒绝这条规则也写在语义提取子代理的规范 graphify/skills/agents/references/extraction-spec.md 中。三种置信度标签对照表标签含义典型例子confidence_score 取值✅ EXTRACTED源码中明确写出的关系import 语句、函数调用、论文引用、see §3.2固定1.0 INFERRED有依据的合理推断两个文件共享同一数据结构、隐含依赖五档离散值0.95 / 0.85 / 0.75 / 0.65 / 0.55⚠️ AMBIGUOUS不确定标记待人工复核手写图里难以辨认的箭头、语义模糊的关联0.1 – 0.3EXTRACTED白纸黑字的事实EXTRACTED 代表证据就在源码里AST 直接提取的 import、calls、contains 等结构边天然就是 EXTRACTED语义路径下只要原文显式写出关系如文档中的引用、交叉引用同样记为 EXTRACTED分数规则极简永远是 1.0没有中间地带。一个值得注意的细节合并图谱时通过别名恢复alias recovery补回来的边只会回填 INFERRED永远不会被升级成 EXTRACTED见graphify/build.py——因为恢复了本身也是一种推断事实等级不容稀释。INFERRED有证据链的合理推测INFERRED 用于模型有把握但不算铁证的关系官方给出的判定口径是reasonable inference合理推断共享数据结构、隐含依赖、跨文件的语义相似。它的打分采用离散五档细则而不是一段连续区间——因为生产数据显示模型在离散评分标准下表现更好分数含义0.95直接结构性证据共享数据结构、跨文件具名引用0.85强推断功能上明显对齐但无直接符号链接0.75合理推断同问题域 形状相似需要一定解读0.65弱推断主题相关无形状证据0.55推测但合理仅表面共现另外使用--mode deep深度模式时graphify 会主动放大胆子更多地提取间接依赖、共享假设、潜在耦合等 INFERRED 边不确定的则降级为 AMBIGUOUS 而不是省略。AMBIGUOUS不确定 ≠ 丢弃官方规则原文是uncertain — flag for review, do not omit。也就是说拿不准的关系不是直接扔掉而是打上 AMBIGUOUS 标记交给人复核分数区间 0.1–0.3。如果一条边连 INFERRED 的 0.55 都够不上规范明确要求标 AMBIGUOUS而不是硬给一个 0.4 以下的低分。在分析环节AMBIGUOUS 的曝光率反而最高graphify/analyze.py的跨文件惊奇度排序按AMBIGUOUS INFERRED EXTRACTED加权——越是没把握的连接越值得拉出来让人看看同时拥有大量 INFERRED 边的上帝节点还会自动生成需要人工验证的问题清单帮你优先复查高风险区域。如何查看自己项目的置信度分布不用翻源码三个入口都现成构建报告graphify/report.py生成的报告中有一行汇总例如Extraction: 72% EXTRACTED · 21% INFERRED · 7% AMBIGUOUS还附 INFERRED 边的平均置信度Wiki 审计轨迹生成的知识维基里每个社区页面都带Audit Trail小节按三个标签列出边数与占比graphify/wiki.pyMCP 服务审计接口graphify serve启动的服务暴露了名为Confidence Audit的资源graphify://audit直接给出三种标签的边数拆解graphify/serve.py。顺带一提导出图谱时若个别边缺失分数graphify/export.py会按标签补默认值——EXTRACTED 1.0、INFERRED 0.5、AMBIGUOUS 0.2——保证下游查询永远有分可用。新手常见问题INFERRED 占比高是不是图谱质量差不一定。文档/论文语料天然推理边多deep 模式也会刻意提高占比建议结合平均分report 里会给出一起看。AMBIGUOUS 边会被自动清理吗不会它们被保留下来供人工复核这也是每条边都有解释理念的一部分。EXTRACTED 一定 100% 正确吗它是确定性 AST 解析的结果、可复现因此被视为事实基线模型推测的内容无法进入这一档。小结标签一句话记忆EXTRACTED源码写明的事实1.0 分INFERRED有证据链的推测五档离散分AMBIGUOUS不确定但值得标记0.1–0.3 分待复核这套三档置信度体系正是 graphify 区别于黑盒向量检索的关键图谱里的每一条边都可解释、可审计、可分级你查询到的每个结论都能追溯到这是事实还是猜测。【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表