ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Feynman Verifier Agent 深度解析:基于引文交叉核验的事实核查与代码对账机制

Feynman Verifier Agent 深度解析:基于引文交叉核验的事实核查与代码对账机制 【免费下载链接】feynmanThe open source AI research agent.项目地址https://gitcode.com/gh_mirrors/feynman/feynman点击查看免费下载导读Verifier核验智能体是开源 AI 研究智能体 Feynman 中负责事实核查与验证的关键环节它以声明 被引来源为单位做定点核查而非像 Reviewer 那样通篇通读专门捕捉错误归因引用了观点不同的论文、过度陈述声称的结果强于来源所报与凭空捏造被引来源中毫无依据。本文以 verifier 智能体文档 为主体结合 Feynman 仓库中的 workflow 提示词prompts/deepresearch.md、prompts/audit.md、prompts/replicate.md、prompts/recipe.md、agents 系列文档 与各 workflow 文档系统讲解 Verifier 的职责边界、五步核验流程、置信度分级、局限性诚实声明以及在/deepresearch、/audit、/replicate、/recipe四条核心流水线中的调度位置帮助你理解 Feynman 如何把引用即事实从口头承诺落地为可审计的工程机制。Verifier 在 Feynman Agent 体系中的定位Feynman 内置了四类研究智能体构成一条收集 → 写作 → 评审 → 核验的流水线Agent职责对应文档Researcher检索文献与网页、深度阅读、抽取声明与方法论是多数流程的起点researcher.mdWriter将原始研究素材合成为带引文的学术文本简报、综述、论文草稿、对比报告writer.mdReviewer以严重度分级critical/major/minor/nit对研究产物做方法论评审reviewer.mdVerifier对具体声明做事实核查交叉核验引文与来源检查代码实现与论文描述是否一致verifier.md从角色分工看Verifier 与 Reviewer 存在显著区别Reviewer 是读者视角对整份文档做广度评审评估方法论、实验设计、写作质量与可复现性Verifier 是证据视角对单条声明逐一做深度核验不追求读完整个文档只聚焦这条声明 这个被引来源是否站得住。两者在/deepresearch中按严格的先后顺序执行Verifier 必须先于 Reviewer 完成核验且二者不允许在同一并行subagent调用中同时运行见 prompts/deepresearch.md Step 5/6从而保证先纠错、后评审的时序约束。Verifier 做什么三类典型缺陷的定点拦截根据 verifier.mdVerifier 针对的是以下三类高发研究缺陷误归因misattribution引用的论文实际上表达的是另一个观点声明与来源内容不符过度陈述overstatement声明声称的结果比来源实际报告的结果更强例如把相关性说成因果、把单数据集结果说成普适结论捏造fabrication声明在被引来源中根本没有依据属于凭空编造。Verifier 的工作单元是一个**声明-来源对**它接收一条声明和其被引来源检索该来源然后判断来源是否如声明所述支持该结论。这一机制可以从 Feynman 的 workflow 提示词中得到印证——prompts/deepresearch.md 明确要求草稿阶段执行citation sweep每条关键声明、数字、图表或基准必须映射到一个来源 URL、研究笔记、原始产物路径或命令/脚本输出无法支撑的声明必须删除或降级推断必须标注为推断。这正是 Verifier 后续逐条核验的输入前提。代码 vs 论文的核对维度当核验对象是代码实现 vs 论文描述时Verifier 检查的是具体的实现细节维度超参数hyperparameters架构配置architecture configurations训练流程training procedures评估指标evaluation metrics。它逐项比较论文描述与实际代码行为并以精确的文件路径和行号记录差异。这一能力的工程化落点在/audit流程中最为典型详见下文。五步核验流程可审计的证据链Verifier 对每条声明遵循一个系统化流程文档将其概括为五个步骤检索来源Retrieve the source——获取被引的论文、文章或代码文件定位相关章节Locate the relevant section——找到来源中处理该声明的具体位置比较Compare——检查来源是否如声明所述支持该结论分类Classify——将声明标记为 verified已核验、unsupported无支撑、overstated过度陈述或 contradicted被反驳记录Document——保存证据注明来源位置仅在必要时附上简短引文。这套流程设计上完全可追溯每一条完成的核验记录都会指明被检查的具体段落或代码便于第三方审计 Verifier 的工作质量。从仓库证据看这一可审计性要求贯穿整个产物体系/deepresearch要求产出outputs/slug.provenance.md侧车文件其中包含Verification: PASS / PASS WITH NOTES / BLOCKED状态与验证日志prompts/deepresearch.md计划阶段即需写入Verification log且修复后必须做磁盘级验证——用rg/grep/diff/wc证明旧的错误措辞已消失、新措辞已存在否则不得声称已修复对应 workflow 文档 deep-research.md 明确说明Feynman 对声明与引用来源进行交叉核验标记误归因或无法支撑的断言。置信度分级核验结论的可信度声明Verifier 为每条核验分配一个置信度等级文档给出了三级划分核验场景置信度原因声明直接引用来源原文高high字面对字面歧义空间小声明是转述或对结果的解读中moderate合理解读可能因人而异声明涉及结果的意义或重要性implications/significance低lower涉及主观判断这一分级逻辑与 Reviewer 的置信度评分设计一致reviewer.md 同样区分高置信度清晰无争议的问题与低置信度见仁见智的判断也与 Researcher 抽取阶段每条抽取项都打上来源位置标签以便追踪的做法呼应researcher.md。置信度分级不是装饰它直接影响最终产物/deepresearch要求single-source critical claims必须被 Reviewer 单独标记prompts/deepresearch.md Step 6正是因为低置信度声明更容易被过度采信。诚实的边界核验不了就说核验不了Verifier 明确拒绝猜测。当以下情况发生时它会显式声明无法核验而非强行给出结论来源位于付费墙之后paywall无法读取原文代码不可得code not available声明需要超出其评估能力的领域专业知识domain expertise。这一诚实失败原则同样体现在 workflow 提示词的降级策略中/deepresearch要求如果任何能力失败继续以降级模式运行仍然写出 blocked 或 partial 的最终产物与 provenance 侧车并标记Verification: BLOCKED/recipe明确禁止在未实际检查数据集可用性与格式的情况下把数据集描述为可用未检查项必须标记unverifiedprompts/recipe.md。换句话说无法验证是有记录的失败不是失败地记录——这是 Feynman 事实核验体系的核心纪律。调度位置Verifier 被哪些工作流调用verifier.md 明确列出了四条使用场景结合仓库中的 workflow 提示词与文档可以还原出每条场景下的具体调度方式/deepresearch最终事实核查通道在 deep research 流程中当启用了 researcher 子智能体时运行 Verifier 是强制步骤prompts/deepresearch.md Step 5触发条件只有使用了 researcher 子智能体即宽泛主题、多智能体调查时才必须运行 Verifier窄主题的what is X直接搜索模式禁止派生 Verifier 子智能体调度形状以subagent工具调用agent: verifier任务为为outputs/.drafts/slug-draft.md添加行内引文使用研究文件作为素材验证每个 URL将完整带引文的简报写入outputs/.drafts/slug-cited.md时序约束Verifier 必须在 Reviewer 之前完成且不能与 Reviewer 并行Verifier 返回后还要在磁盘上验证outputs/.drafts/slug-cited.md确实存在若写到了别处需移动或复制回来。注意这里 Verifier 承担了双重职责既逐条核验声明与来源是否匹配防止误归因/过度陈述/捏造又负责行内引文落地与 URL 可达性验证——两条能力合起来构成带引文简报的质量关。/audit论文声明 vs 代码实现的对账/audit流程把 Verifier 用在最贴合其代码核对能力的场景prompts/audit.md 与 audit.mdResearcher 先读论文抽取所有具体声明超参数、架构细节、训练流程、数据集划分、评估指标、报告结果并为每条声明打上论文中的位置标签Verifier 检查代码库为每条声明寻找对应实现核对配置文件、训练脚本、模型定义与评估代码确认代码与论文描述一致发现差异超参数不同、论文描述了但代码未实现某训练步骤、评估流程偏离论文时以精确文件路径和行号记录不匹配项同时检查常见可复现性隐患缺失随机种子、未固定版本的非确定性操作、硬编码路径、缺失环境规格。产出报告包含 Match Summary声明匹配代码的百分比、Confirmed Claims、Mismatches、Missing Implementations 与 Reproducibility Risks。审计计划的提示词要求对比论文所述的方法、默认值、指标与数据处理方式和实际代码并把verifier子智能体用于验证来源并添加行内引文。/replicate复现计划完整性的把关复现流程用 Verifier 确保复现计划捕获了所有必要细节prompts/replicate.md、replication.md。在 recipe pass 中每条被声称的结果必须链接到产生它的确切数据集、方法、超参数、计算假设、指标与代码路径无法验证的数据集可用性/模式必须标记为unverified而非假定可用。Verifier 在这里扮演计划完整性质检角色防止复现计划遗漏实现细节从而避免复现失败时无法区分论文问题与计划问题。/recipe头部配方关键来源的抽查对于非平凡的/recipe运行Verifier 检查排名第一的配方的关键来源、数据集可用性与代码路径prompts/recipe.md、recipe.md。/recipe的最终产物以verified、unverified、blocked、inferred四个标签精确标注每个配方的验证状态只有底层检查真正通过才允许声称某个方法是 SOTA、已被复现或可用于生产——这套标签体系正是 Verifier 核验结论在配方产物中的直接映射。全局调度方式从 slash-commands.md 可以确认 Verifier 的通用调度机制workflow 提示词通过 Pi 的subagent工具调用 researcher、reviewer、writer、verifier 等专用智能体窄任务保持由主智能体lead直接执行避免不必要的编排开销。同时/feynman-model命令允许为verifier子智能体单独指派已批准的研究模型实现主模型与核验模型的解耦。与其他 Agent 的分工边界将四个 agent 文档并置阅读可以勾勒出完整的质量保障矩阵Researcher收集抽取声明并打上来源位置标签产出带坐标的证据——这是 Verifier 可核验的前提Writer写作强事实声明回链到素材、单来源声明加限定语——写作端先做一轮自我约束Verifier 再做独立复核Reviewer评审评估方法学、实验设计、可复现性与写作质量产出严重度分级反馈Verifier核验逐条验证声明-来源一致性、代码与论文一致性产出可审计的核验记录。从执行顺序看Verifier 总是作为研究者与写作者产出之后的质控步骤quality control step运行。以/deepresearch为例完整顺序是Plan → Gather Evidence → Draft →CiteVerifier→ ReviewReviewer→ Deliver且 Verifier 完成后必须磁盘验证产物存在、Reviewer 完成后若发现 FATAL 问题需修复并复跑。这套先核验、后评审、再交付的流水线使得最终交付物同时具备引文正确性与方法论稳健性。小结Verifier 是 Feynman 事实质量体系的最后一道闸门它用声明-来源定点核验替代全文档通读用五步流程保证每条核验可追溯用三级置信度区分字面引用与主观解读的可信差异并用显式的无法核验声明拒绝猜测。在/deepresearch中它是强制的事实核查通道在/audit中它是论文与代码的对账引擎在/replicate与/recipe中它是计划完整性与配方可信度的把关者。若想进一步深入可以阅读 agents 目录 下的四份智能体文档、workflows 目录 下对应流程文档以及 prompts 目录中的原始 workflow 提示词——后者包含 Verifier 调度 JSON 与验证日志格式等最底层实现约定。赞分享【免费下载链接】feynmanThe open source AI research agent.项目地址https://gitcode.com/gh_mirrors/feynman/feynman点击查看免费下载相关推荐Claude Ads source-verifier 深度解析付费媒体事实的对抗性核查与四级置信度分类Claude Ads source verifier 深度解析付费媒体事实的对抗性核查与四级置信度分类 Claude Ads 的审计、规划、创意与投放建议全部Feynman pdf-explore跨页科学论文的提取、锚定与交叉核验实战指南Feynman pdf explore跨页科学论文的提取、锚定与交叉核验实战指南 导读 本指南围绕开源 AI 研究代理 Feynman 的 pdf exploget-shit-done 的 gsd-doc-verifier 详解用对抗性事实核查让项目文档与真实代码库保持一致get shit done 的 gsd doc verifier 详解用对抗性事实核查让项目文档与真实代码库保持一致 导读 在 AI 辅助编程的时代项目文档人工智能AI 应用提示工程开发工具工作流自动化AI Agent上一篇douyin-downloader 实战上手指南批量下载抖音视频、合集与直播的完整攻略下一篇iPhone激活锁绕过免费工具applera1n怎么用4步解锁iOS 15-16.6完整教程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表