ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

对威胁报告知识图谱提取的可重复性审计

对威胁报告知识图谱提取的可重复性审计 大家读完觉得有帮助记得关注和点赞摘要安全团队和研究人员根据已发布的三元组F1分数来选择用于威胁报告的知识图谱提取工具然而这些分数取决于预测三元组如何与黄金标准标注进行匹配。在被检查的十二个系统中我们仅能为其中五个系统重新实现其所陈述的匹配规则。在共享文档上使用八种协议对十个系统输出进行重新评分结果导致四十五对两两排序中的十一对发生逆转一个固定的预测集在0.16至0.70的F1范围内波动。在GRID的外部378项校准集上没有任何机械匹配器词汇、嵌入或蕴含与多人评审裁决的一致率超过71%而LLM评判员则达到了86%。为了将组件效果与匹配器奖励分开我们构建了CTIForge其确定性验证层可以在提取保持字节完全相同的情况下进行变化。在七个测试部署配置中验证提高了所有四个托管后端hosted backbones的精确率并降低了所有三个离线后端的精确率。由于骨干模型、解码和后端特定提示共同变化这是一个描述性的划分而非孤立的服务效应。它同时伴随着明确质疑实体类型的动作大约增加了2.8倍这与人工编写的规则编码了针对它们所开发的提取器的约定是一致的。我们发布了流水线、协议套件和每条三元组的审计记录。索引词网络威胁情报知识图谱神经符号AI信息提取MITRE ATTCK基于LLM的提取符号验证I 引言图1CTIForge流水线架构。提取是每个块chunk的单次LLM调用其后的每个阶段都是确定性的这正是允许所有消融分支都源自同一次提取过程的原因。网络威胁情报CTI以叙述性散文形式分布在供应商报告中将其转换为关于威胁行为体、恶意软件、漏洞、技术和基础设施的知识图谱现已成为安全运营的常规部分 [1, 2]。随之而来的是源源不断的提取系统最近大多基于大型语言模型构建从业者和研究人员选择它们的方式与选择任何工具的方式相同阅读每篇论文报告的数字。问题不仅仅在于提取本身不完美而在于用于比较不完美提取的分数本身可能是不可比较的。这些数字几乎总是针对黄金标准标注的三元组F1。这个数字的含义完全取决于预测三元组何时被视为与标注三元组匹配——实体名称必须完全相同还是仅需重叠关系标签必须完全一致还是仅需兼容主语和宾语颠倒是否算数以及匹配是在文档内还是在整个语料库池化后进行。我们审计了最近十二个CTI提取系统和基准测试的匹配规则是否能从其出版物中重建表I。被检查的论文中没有两篇指定了相同的规则。有五条规则是可重新实现的有三条命名了一个规则族但未固定具体实现还有四条未陈述任何标准。例如Fieblinger等人 [3] 拒绝生成式输出的精确匹配评估并采用n-gram重叠。最具影响力的案例是CTI-Nexus [4]一个常见的比较目标。它将一个预测在“语义匹配”黄金三元组时计为正确但未指定编码器、阈值或决策规则。后续一篇重复该比较的论文在未定义自身匹配器的情况下继承了一个无法复现的标准。本文探讨的是匹配器在多大程度上决定了结果。在共享文档集上使用八种协议对十个已发表系统进行重新评分导致四十五对两两排序中的十一对发生逆转。保持一个固定预测集不变仅改变匹配器其三元组F1从0.16变化到0.70。在GRID [5] 的外部378项校准集上没有任何机械协议与多人评审的人类判断在超过71%的项目上达成一致。在匹配前将整个语料库池化——这是几个公共执行工具所做的包括在我们发现之前我们自己的工具也是如此——会将一份报告中的预测错误地记入另一份报告的金标准从而使真正例膨胀6.4%。安全后果是直接的。一个选择提取流水线的防御者或一个选择基线进行改进的研究人员所依据的证据可能无法在评分规则改变后幸存。观察到的协议跨度可以使相同文档上的相同预测看起来像是来自不同系统的输出。已发布工件无法回答的一个问题。审计已发布的输出可以限定比较的含义但它无法说明任何单个设计选择贡献了什么因为该选择无法在别人的工件中被关闭。因此我们构建了CTIForge一个五阶段的神经符号流水线其确定性验证层——类型对约束、指示器规范化、证据对齐过滤每个动作按三元组记录——可以在提取保持字节完全相同的情况下被启用或禁用图1。CTIForge是本文的实验装置而非本文提出的方案并以此形式发布。按此方式使用CTIForge产生了一个出乎意料的结果。在七个测试配置中验证的精确率效果符号发生了变化它提高了所有四个托管后端的精确率并降低了所有三个离线后端的精确率且两组无重叠。这种分组是观察性的而非孤立的服务效应因为骨干模型、解码和后端特定提示是共同变化的。这种分裂并非由未经验证的F1或列出的参数数量排序。相反它追踪的是验证器有多少工作是在质疑实体类型宽松的类型标注可能触发对实质上正确的三元组的约束。由于规则是针对前沿模型输出开发的它们编码了其约定。确定性的并不意味着与模型无关——在这条流水线或一般的神经符号流水线中都是如此。同时规范化canonicalization重写了度量指标未注册的一小部分三元组。本文有四个贡献。首先我们提供了一项可重复性审计在共享文档上使用通用协议套件对十个系统输出进行重新评分。其次我们针对外部多人评审集校准机械协议而不是假设语义相似度能追踪人类判断。第三我们提供了在七个部署配置中对确定性验证和规范化的共享提取消融实验在固定预测条件下隔离每个下游模块的效果。第四我们测量了两个可纠正的评估缺陷语料库池化匹配和使用由参与者自身模式定义的度量指标进行比较。我们发布了代码、配置、日志和每条三元组的审计记录附录G。实现、评估工具以及第六节-C中记录的原始错误分类日志均已公开。本文报告的每条三元组的验证记录均可直接查阅。II 相关工作II-A 评估CTI提取用于CTI语言任务的基准测试发展迅速——CTIBench [6] 和 SEvenLLM [7] 都在CTI能力上评估了LLM——但图构建结果仍然几乎完全依赖于针对黄金标注的三元组F1。由于匹配规则通常是不正式的或缺失的已发表的数字无法直接比较。表I将十二个系统和基准测试按我们能重建该规则的完整程度分组有五个可从论文中重新实现有三个留下编码器或阈值未固定还有四个未陈述任何标准。因此有七个出版物在名称规范化、关系兼容性或文档级作用域方面留下了未解决的选择。GRID [5] 是最接近将测量工具本身作为评估对象的先前工作它针对多人评审的人类裁决校准了一个LLM评判员。我们使用该校准集来评估十个机械协议并将问题扩展到跨八个协议和十个系统输出的排序敏感性。我们通过阅读每篇出版物的评估部分并搜索预测何时被计为正确的定义来对其进行分类在未找到定义的地方我们如实记录而不进行推断。这由一位编码员执行一次没有评分者间信度统计 [8]仅在发布的代码中陈述的标准可能被遗漏。这些计数描述的是这些被检查的出版物而非所有CTI提取系统。将重新评估作为一项贡献。安全研究有一条成熟的工作线将评估实践本身作为研究对象而非手段。Olszewski等人 [8] 在领域尺度上测量了这个问题发现近750篇机器学习安全论文中有60%未发布运行实验的代码Arp等人 [9] 分类了反复出现的、会夸大报告性能的陷阱TESSERACT [10] 表明去除时间偏差会改变恶意软件分类的结论。更窄范围的重新评估发现基于图的入侵检测结果大多无法复现 [11]数据集重复和未调整的基线解释了静态Android恶意软件检测中报告的大部分优势 [12]并且38项被调查的DGA论文中大部分建立在脆弱的基础之上 [13]。在CTI领域Schlette等人 [14] 定义并可视化质量维度Yang等人 [15] 评估数据源可信度Geras和Schreck [16] 考察了运营质量保证。这些工作问的是情报本身是否好我们问的是用于比较构建情报的系统的数字是否好。同样的测量工具问题也出现在安全领域之外。Wadhwa等人 [17] 放弃精确匹配而采用人工评估因为生成式模型以度量指标拒绝的形式表达正确关系。Swarup等人 [18] 同样发现提取质量在面对遇到的数据时并不稳健而GenRES [19] 提出了一个多维度的替代方案来替代针对标注参考的精确率和召回率。Tan等人 [20] 在黄金数据中定位了一个互补的失败重新标注4,053份DocRED文档恢复了原始方案遗漏的关系。SQC-Score [21] 通过改进匹配和用自然语言推理丰富黄金集来解决这两个问题。我们以相反方向测试了蕴含——作为针对现有黄金的匹配器而非作为扩展它的手段——并发现它在此处没有增加价值第六节-A这并不影响丰富任务。Flood等人 [22] 同样在安全领域表明审计一个评估工件本身就可以是一项贡献。我们的贡献是CTI知识图谱案例其中的偏差既不是时间性的也不是与采样相关的也不是数据属性而是存在于匹配规则中——这是一个报告工件而非实验设计的产物因此可以零成本地纠正。关于ATTCK技术提取的同期工作报告了类似的评估设置敏感性 [23, 24]。II-B CTI提取系统从威胁报告中提取已经历了三代由Rahman等人 [25] 进行了深度综述而对于关系提取则由Arikkat等人 [26] 进行了系统化。这些工作对方法进行了分类我们审计用于对它们进行排名的度量标准。标注语料库如MalwareTextDB [27] 确立了后来系统使用的黄金标准集惯例。基于规则的系统如TTPDrill [28] 提供了可解释性但缺乏适应性。有监督的神经流水线——TIMiner [29]、Open-CyKG [30]、CyberRel [31]、Vulcan [32]、CSKG4APT [33]、KnowCTI [34]、CyberEntRel [35] 和 AttacKG [36]——提高了覆盖范围但代价是依赖于标注和对新措辞的脆弱性。上下文学习消除了标注需求CTI-Nexus [4] 使用示例检索和多阶段提示LLM-TIKG [37] 从LLM标注的数据中蒸馏出一个较小的模型而CTIKG [38] 在长报告上协调多个代理。一条并行的线路通过角色专业化 [39]、本体一致性 [40, 41, 42] 或显式推理轨迹 [43] 在模型周围增加了结构。在安全领域之外EDC [44] 将规范化canonicalization作为基于LLM的图构建的一个命名阶段正如我们在模块D中所做的那样。这些系统的共同点是本文所审计的报告惯例。每个系统都通过将预测三元组与黄金标注匹配来进行评估每个系统都将三元组F1作为头条指标报告并且——根据表I——大多数系统并未固定决定匹配的规则。我们的关注点不在于任何特定系统的设计而在于对它们进行排名的数字是否如表面所示。最近一项统一的重新评估同样发现自定义本体、数据集和指标使得已报告的TTP结果难以比较。II-C 同期工作2026年在本工作准备期间出现的几个系统汇聚在重叠的目标上。GRID [5] 使用任务库强化监督训练了4B参数的提取器保留了逐字的证据锚点并贡献了一个包含249篇文章的基准测试配备了一个针对三位评审员校准达到86.0%一致性的LLM评判员。TACTIC-KG [41] 将构建过程分解为在3B–8B模型上的提取器、类型化器、验证器和策展器代理。ANCHOR [40] 在本文使用的相同149份报告上强制UCO、STIX 2.1和MALOnt的SHACL一致性而TTPrint [46] 在验证之前将每个候选技术锚定到一个局部证据窗口。在安全领域之外Loconte等人 [47] 将基于本体的提取后校正形式化为通用配方。相关工作还考虑了提取后的来源和佐证TRACE-CTI [48]以及多代理CTI图构建KGAgent4CTI [49]。因此显式的符号验证已不再独特。仍然开放、并且本文所测量的是用于比较这些系统中任何一个的评估是否支持该比较。表I十二个CTI提取系统和基准测试报告的匹配标准。✓ 标记可从出版物重新实现的规则× 标记不可重新实现的规则。灰色行是在第六节-A中同样使用八种协议重新评分的系统。系统报告的匹配标准可重现性规则指定得足够精确以重新实现CTIBench [6]命名实体精确匹配✓GRID [5]显式规则集LLM评判员✓TACTIC-KG [41]嵌入相似度T0.6✓ANCHOR [40]精确匹配加部分得分✓Fieblinger等人 [3]rouge n-gram重叠✓相似度族被命名编码器或阈值未固定CTI-Nexus [4]“语义匹配”未定义×LLM-TIKG [37]余弦相似度阈值未说明×SEvenLLM [7]语义相似度 ROUGE-L×未找到匹配标准CTIKG [38]未说明×AttacKG [36]未说明×CTIExpert [39]未说明×TTPrint [46]未说明×II-D CTIForge的定位先前工作主要优化神经侧CTI-Nexus [4] 改进了上下文提示CTIExpert [39] 在专业模型之间进行仲裁CTIKG [38] 跨代理协调长上下文推理。2026年的并发系统通过不同方式增加了结构控制——ANCHOR [40] 中的SHACL一致性、TACTIC-KG [41] 中的学习验证器、TTPrint [46] 中的跨度锚定。CTIForge在该空间中占据一个特定点。提取是单次标准LLM调用随后是一个确定性的验证层同一个三元组总是触发相同的规则、分类的每个动作映射到一个固定的分类法并按三元组记录触发的规则可从工件中恢复。在我们检查的系统和已发布工件中没有哪一个同时暴露了全部三个属性。正是这种组合使得第六节-C中的错误分析成为可能一个学习验证器的标签本身并不揭示是哪个约束产生了它。III 问题形式化作为自由参数的评分设D {d₁, …, dₙ}为CTI文档。一个系统每文档发出一组预测三元组Ŷ_d { (e_i, r, e_j) }其中e_i, e_j是带类型的实体提及*r* 是一个关系基准测试提供黄金三元组Y_d。每个预测三元组还带有一个证据跨度 *s*、一个源标识符和一个验证状态ν ∈ {raw, validated, repaired, rejected}。比较系统需要决定ŷ何时被计为 *y*。我们使该决策显式化。一个匹配协议是一对M (μ, σ)一个谓词μ(ŷ, y) ∈ {0, 1}和一个作用域规则σ固定每个预测所针对的候选黄金集。给定M真正例通过一个贪心的一对一分配得出其中每个黄金三元组最多被消耗一次并且这正是写成这样的意义所在报告的分数是协议的函数与预测本身一样多。当F1(Ŷ_A, M₁) F1(Ŷ_B, M₁)且F1(Ŷ_A, M₂) F1(Ŷ_B, M₂)时两个系统在M₁, M₂下发生排序逆转。谓词μ沿着文献中使用的三个轴变化名称相等性精确字符串、包含、词干化令牌重叠、高于阈值的嵌入相似度、蕴含关系相等性规范化后相同、来自兼容集、或忽略以及参数顺序固定或可交换。作用域σ要么是每文档的要么是在语料库上池化的。第六节-A 实例化了该空间中的八个点并测量了后果附录E完整给出了每个定义。知识图谱质量是一个已研究的问题拥有成熟的词汇表——准确性、完整性、一致性、时效性——以及评估每个维度的文献 [50]。该词汇表尚未被CTI提取领域采用在该领域中单一的金标准匹配F1代表了所有维度我们正是考察这种替代。一个协议的两个属性值得分离。只有当μ不依赖于任何参与者的本体时它才具有可比性——STIX 2.1词汇表合规性和证据存在性符合条件而系统自身的类型对表则不符合因为定义该表的系统在提取时强制实施了它并且不可能在该表上得分低。并且只有当μ与裁决同一对的人类判断一致时它才是经过校准的第六节-A 测量了这种一致性而不是假设它存在。我们的装置第四节以精确率和来源provenance为目标而非召回率在图构建之前拒绝或修复结构上无效的输出在每条边上保留证据跨度和验证状态并在无模糊共指的情况下跨文档合并。它使用了一个紧凑的本体包含14个实体类型和12个关系类型库存表B1B2和类型对约束表C1在附录B中。IV 装置CTIForge流水线第六节-A 界定了已发布比较的含义但它无法说明任何单个设计选择贡献了什么别人发布工件中的一个组件无法被关闭。CTIForge的存在就是为了使这一点成为可能。它是一个五阶段流水线图1其中每个阶段都可独立切换提取可与下游一切分离并且到达图的每条三元组都带有验证状态、源块标识符和可追溯到原始句子的证据跨度。一个属性对后续测量至关重要。提取之后的每个阶段——验证、显著性过滤、规范化、对齐——在给定输入时是确定性的而链接预测唯一另一个调用模型的阶段在验证开关之前运行。因此所有消融分支都可以从同一次提取过程中派生出来因此一个分支与另一个分支的区别仅在于被测试的模块而无其他差异。第六节-B 依赖于这一点。提取是概率性的验证是确定性的规范化是保守的且基于别名的而非基于嵌入的融合是置信度感知的且保留来源。我们将每个阶段描述到测量所需的深度实现细节在附录C中。IV-A 摄取与提取模块 A–B报告被分割为段落级块具有稳定的标识符和指向源文本的字符偏移量因此下游每个声明都保留有产生它的句子的指针。提取是每个块针对受模式约束的提示的单次LLM调用具有可选的小样本检索并且仅在文档图不连通时进行第二次调用以进行链接预测。将提取保持为每个块一次调用使得共享提取消融在七个后端上运行时成本足够低。IV-B 符号验证与修复模块 C模块C是本文测量的组件因此我们精确地描述它。每个预测三元组被视为一个候选必须在图构建之前通过一系列确定性检查空字段拒绝指示器格式修复针对Other的类型修复针对固定约束表的类型对验证并对反转参数进行自动交换传递自环拒绝针对引用跨度的证据对齐对“the attacker”等提及的占位符检测以及ATTCK标识符验证。每个检查发出三种动作之一——rejected、repaired或flagged——进入按三元组记录的日志中并用十四个错误类别之一标记因此允许或修改任何边的规则可以从工件中恢复而非从代码中。一个独立的保守修复步骤在证据支持时将弱的related_to关系提升为特定类型对十一个关系类别使用关键词匹配。它不会默认提升associated_with并且在行动之前要求两个实体提及都出现在证据跨度中。该设计的两个属性在后面起到关键作用。这些检查是带有固定阈值的人工编写规则是针对强提取模型的输出开发的——第六节-B 显示了当它们遇到较弱模型时会发生什么。并且它们是确定性的这允许消融分支从存储的提取输出中重新计算而非重新提取。IV-C 接地、融合与可选阶段模块 D–E模块D通过三次传递减少表面碎片化基于别名的规范化使用一个包含已知行为体、恶意软件和工具的精选表在保守阈值τ0.85下的类型门控嵌入对齐因此恶意软件名称永远不会与组织合并以及ATTCK技术接地它附加一个标识符作为来源而非重写表面形式。模块E在保留每条三元组来源和置信度的同时合并每个文档的图。三个可选阶段——链接预测、基于嵌入的实体对齐和显著性过滤——被保留另外三个被实现但在CTI文本上过度生成后被禁用附录G1。由于规范化会重写黄金标注逐字记录的字串它可以提高图的可用性但会牺牲与黄金匹配的F1。第六节-B 测量了这种权衡并发现度量指标既未记录增益也未记录损失。V 实验设计我们首先改变匹配协议以测量评估敏感性然后固定提取以隔离验证和规范化分析产生的错误类别在统一标准下比较系统最后检查骨干和运行时限制。V-A 数据集与资源表G1总结了评估中使用的数据集和外部资源。CTI-Nexus基准。主要评估语料库包含来自CTI-Nexus数据集 [4] 的149份带有黄金标注的CTI报告。每份报告包含JSON格式的带类型实体和显式三元组。官方测试集11份文档用于与CTI-Nexus报告指标进行直接比较其余138份文档作为小样本示例池。CTIKG基准。次要基准包含来自CTIKG数据集 [33] 的255个CTI句子带有693个黄金三元组。每个句子都标注了括号格式的三元组并标记了其ATTCK战术。关键地CTIKG自身的预测三元组也包含在数据集中从而可以在相同的评估标准下进行正面比较。训练/测试分离。对于CTI-Nexus评估小样本示例仅从训练集抽取。检索器在示例选择期间排除当前文档以防止琐碎的泄漏。V-B 研究问题RQ1: 该文献中报告的结果在多大程度上由匹配协议而非由系统决定RQ2: 当提取被固定时符号验证模块C和规范化模块D贡献了什么RQ3: 错误在符号错误分类法中的分布如何RQ4: 在统一标准和匹配骨干下CTIForge与先前系统相比如何RQ5: 什么限制了进一步的改进以及该限制中有多少是提取模型的RQ6: 相对于可比较的流水线CTIForge的运行成本是多少V-C 评估指标匹配作用域为每文档。在匹配前将所有文档的预测和黄金池化为扁平列表允许将一份报告的预测记入另一份报告的金标准在我们的数据上这使真正例膨胀了6.4%。所有报告的数字均使用每文档作用域。我们报告三个系列并保持它们分开因为它们支持不同的论断。黄金匹配指标主语-关系-宾语忽略关系的 主语-宾语对在陈述的匹配器下与标注进行比较。两者都不是严格相等匹配两者都应用软名称匹配并且三元组指标还接受一个固定的关系兼容集因此两者在整个过程中都应被视为软协议。与模式无关的指标——证据存在性、重复率和外部STIX 2.1关系词汇表合规性——不依赖于任何参与者的本体因此对跨系统比较是有效的。与模式相关的指标根据我们自己的类型对表评分是定义性的验证器在提取时强制实施该表因此CTIForge不可能在其上得分低。我们在附录I中报告它们作为该层执行其合约的证据而绝不作为优于另一个系统的证据。匹配器定义、规范化规则和类型等价组在附录E中给出。V-D 实验配置除非另有说明所有实验均使用精确优先precision-first配置。GPT-4o是完整的149文档CTI-Nexus运行和匹配骨干比较的默认骨干两个系统均通过OpenRouter [51] 使用。20文档开发切片使用Mistral Small 3.1 24B。第六节-E中的替换研究通过托管API增加了MiniMax-M3、Claude Haiku 4.5和Sonnet 4.5以及在一张消费级GPU上离线运行的Mistral-7B-Instruct、Qwen2.5-7B-Instruct和Gemma-2-9B。所有提取后阶段都是相同的且确定性的。托管提取使用温度0.1离线提取使用贪心解码并在公共提示中添加了一个本地JSON格式包装器。因此骨干模型、服务堆栈、解码和包装器是共同变化的因此本研究测量的是跨部署配置的迁移而非孤立的服务效应。我们排除了两个候选托管骨干因为它们的温度设置无法匹配详见第七节。验证保持证据拒绝启用规范化使用对齐阈值τ0.85保留的增强是链接预测、基于嵌入的实体对齐和显著性过滤。每个配置都已发布附录G1给出了完整的超参数表。V-E 消融设计模块级消融在完整基准上隔离了符号验证和规范化。提取运行一次所有分支都源自相同的原始三元组下游每个阶段都是确定性的因此分支仅在被测试的模块上有所不同。如果端到端运行每个分支则会将模块与提取模型的新采样混淆并且在我们使用的温度下这种重采样噪声与所测量的效应大小相当。增强级消融切换BCD周围的可选神经符号附加组件保留在附录G1中。VI 结果与分析我们首先报告测量问题。本节中的每个后续数字都是由一个匹配协议产生的第六节-A 确立了该选择在多大程度上决定了结果后续结果应在该界限的背景下阅读而非按面值接受。VI-A RQ1: 匹配协议在多大程度上决定了结果上面的每个数字都是由一个匹配协议产生的。两个测量界定了该选择在多大程度上决定了结果。发现1机械协议在GRID的人工裁决集上留下了显著的差距。我们针对GRID评判员校准集 [5] 的378个裁决项目对十个协议——精确匹配、三个软词汇变体包括我们的、三个嵌入阈值和三个自然语言推理阈值——进行评分在该集中三位评审员裁决了一条边是否与参考图匹配。一致性范围从0.598到0.706图3(a)主要失败是欠匹配严格协议遗漏了人类认为匹配的40.2%。部分原因是匹配器过于严格部分原因是黄金标注存在Tan等人 [20] 为DocRED记录的那种不完整性——一个正确的预测如果没有标注的对应项就无法与错误区分。没有一个机械协议超过0.71包括我们专门添加的蕴含家族以测试语义匹配器是否能突破这个上限它未能做到。一个LLM评判员在相同项目上达到了0.860。由于378个项目的分辨率约为±0.05因此机械协议应被视作一个整体而非一个排名与评判员的差距是该宽度的数倍。该领域报告的测量工具因此在大约每十个项目中就有三个与人类裁决不一致。我们不将评判员的优势解读为不加批判地采用评判员的建议它们带有自己已记录的偏见包括位置、冗长和自我偏好效应而人工评估者也并非没有偏见 [52]。评判员的优势也不能跨设置迁移。Laskar等人 [53] 在三个生物医学关系提取数据集上对八个LLM评判员进行了基准测试发现其准确率低于50%这主要是因为提取的关系不遵循任何标准格式。该条件尤其适用于表I中的几个系统。该比较仅表明机械匹配器留下了很大的差距而并不意味着任何特定的替代方案能弥合该差距。发现2系统的排名在很大程度上是匹配器的属性。我们在共享的50份文档上使用八种协议对十个已发表系统——CTI-Nexus、CTIKG、AttacKG、KnowGL、GraphRAG、Graphiti、Cognee、LLM-CAKG以及两个GRID变体——进行评分。这些预测的来源。 我们没有重新运行这些系统。我们使用GRID [5] 发布的预测缓存。选择该缓存有两个标准。首先统一骨干缓存中的每个系统都在相同的提取模型上运行因此骨干是固定的匹配器是唯一的变量。其次共享文档所有50篇文章都是我们149文档基准的一个经过验证的子集因此黄金标注与本文通篇使用的相同。如果自己重新运行十个系统会重新引入审计本意要消除的混淆因为每个系统都将在其作者假定的任何骨干上运行。这种继承也限定了该比较所允许的结论。由于每个系统运行的骨干并非其作者选择的骨干这些数字并不能证明任何流水线优于另一个我们也不将其用于此目的它们仅仅是关于排序对匹配器敏感性的证据。覆盖范围是我们149份文档中的50份因此逆转计数是在更大共享集上可能显示的下限而非总体值的估计。缓存中缺失的系统在此分析中缺失我们没有主动排除它们。十个系统上的八种协议逆转了45对两两排序中的11对图2。这些逆转背后的波动并非微不足道。GraphRAG在精确匹配下得分为0.000而在忽略关系时为0.414。AttacKG和KnowGL同样在一个协议下为零在另一个协议下为非平凡值原因相同对于发出自由文本关系的系统来说精确字符串相等是无法达到的。一个系统在此处的排名在很大程度上是匹配器的属性。图2八种匹配协议下十个已发布系统之间的两两排序关系。每个单元格统计的是行系统在协议中优于列系统的次数颜色深浅对应这一统计值。带边框的单元格表示十一对在不同协议下排序不稳定的系统组合。发现3相同的预测支持报告的F1有四倍的范围。固定一个CTIForge预测集——附录J的149文档GPT-4o运行——仅改变匹配器在七个协议上其三元组F1图3(b)从精确匹配下的0.1577变化到嵌入匹配器τ0.60下的0.6994在相同预测上的跨度达0.5417图3(b)。我们报告的协议给出0.4877。以相同方式评分的CTI-Nexus范围在0.2416–0.7339。在此对比中没有排序翻转——CTI-Nexus在所有七个协议下均领先——因此此处协议决定了数值大小而非排名上面的十个系统比较显示了它也在决定排名的情况。这种跨度并非由任何系统表现不佳引起。它源于表I中协议未固定的三个选择实体名称必须相同还是可以重叠关系标签必须完全匹配还是仅需兼容以及匹配作用域是在文档内还是池化。每一个都是报告决策而非实验决策并且在结果表中都是不可见的。将已发表的0.16与已发表的0.70进行比较的读者会推断出不同的系统而非不同的三个决策集。我们将此放在首位因为它界定了后续每个比较论断包括我们自己的论断。一个在外部校准集上每十个项目中就有三个与人类裁决不一致并在我们的缓存中重新排序了四分之一系统对的测量工具不支持将金标准匹配F1的微小差异解释为关于系统的证据。剩余问题是在这一限制下回答的第七节将回到应该报告什么的问题。(a) 在378项GRID集 [5] 上与人类裁决的一致性我们的结果以红色标出该条带表示在此样本量下±0.05的分辨率。(b) 相同固定预测集在七个协议名称从(a)缩写下的三元组F1。虚线标记我们报告的协议。图3作为自由参数的匹配协议。没有机械协议能达到LLM评判员的水平其数字是[5]中评审员与其一致的比例而非独立重新测量并且在它们之间的选择会使报告的F1移动超过半个点。VI-B RQ2: 符号层贡献了什么表II报告了在所有149份CTI-Nexus标注报告1,824个黄金三元组上的完整流水线结果使用GPT-4o作为提取骨干并使用附录表G3中的增强标志。表II在CTI-Nexus基准149份报告1,824个黄金三元组上的完整流水线结果。三元组匹配在附录E的三次传递协议下比较主语、关系和宾语不比较实体类型。S-O对忽略关系。指标精确率召回率F1三元组 (S-R-O)0.53310.42820.4749S-O对忽略关系0.59590.47860.5309实体类型分类0.5479 准确率 / 0.5082 微平均F1预测三元组数1,465处理时间总计1586.2秒 / 每文档10.6秒两个观察结果构成了其余结果的结构。首先S-O对F1远超三元组F1因此系统识别了大多数关系的参与者剩余差距集中在关系规范化而非实体识别上。其次流水线发出的候选数少于黄金三元组数这是精确优先配置的故意结果它构成了第六节-E中召回上限的背景。发现4验证的观察效果将测试的托管和离线配置分开。一个验证层预期会通过丢弃不良输出来权衡召回率以换取精确率。在七个测试配置中它对所有四个托管后端都做到了这一点而对我们在本地硬件上运行的三个离线后端则一个都没有。表III报告了每个骨干的三个分支每个分支源自一次共享提取过程精确率列在该观察到的边界处改变了符号并且两组在任何列上都没有重叠。由于服务模式并非与骨干、解码和后端特定提示独立地变化该边界是描述性的而非因果性的。它并非由未经验证的F1排序——提取F1最低的托管模型仍然获益而得分高于它的离线模型仍然受损——也并非由离线组内的参数数量排序其中最大的模型落在两个较小的模型之间。七个配置是一个观察而非定律两个托管的变化太小而无法单独承载权重可辩护的陈述是没有测试的托管后端损失了精确率而每个测试的离线后端都损失了。发现5这种反转与模式一致性不匹配是一致的。我们将类型误分配和不可能类型对动作分类为明确质疑实体类型的动作结构和占位符动作被排除在该类别之外。它们在测试配置组之间的比例差异显著图4托管后端大约每八个动作中有一个离线后端大约每三个动作中有一个且无重叠。这种关联与模式一致性不匹配是一致的。类型对约束是级联中最锐利的工具因为不可能的对会被直接拒绝而非标记因此对其实体进行宽松类型标注的骨干可能会在实质上正确的事实上触发该规则。我们的类型对表、证据阈值和占位符启发式是针对前沿模型输出开发的并假设骨干能尊重给定的本体。较小的模型可以产生在结构上更嘈杂但并不更不准确的三元组——离线后端的原始精确率与托管后端相当并且在其中两个上更高附录表F1——而规则可能将噪声与信号一起拒绝。神经符号流水线的符号部分并非仅仅因为是确定性的就与模型无关它继承了产生其所读文本的任何东西的约定。图4验证诱导的精确率变化与质疑实体类型的动作比例的对比每个骨干一个点。虚线标记无变化。部署组是描述性的因为骨干、解码和服务栈共同变化。发现6度量指标完全无法看到规范化。 在每个骨干上BCD的得分与BC在四位小数上相同然而在MiniMax-M3上两个预测集在1,571个三元组中的54个上不同。模块D重写了表面形式——别名解析、大小写、ATTCK技术名称——而匹配器的软名称比较吸收了每次重写。度量指标并非在评判规范化为中性它根本无法看到它。第六节-A 允许以不同权重来解读这些缺陷在一个如此依赖协议的测量工具下第三位小数的F1变化在任何方向上都不是证据而精确率的符号翻转伴随着正确移除份额的翻倍则是。表III七个骨干上的模块消融。在每个骨干内所有分支源自一次提取过程。ΔP是BC减去Bcollateral附带损失是移除中丢弃了一个正确三元组的份额type类型是质疑实体类型的动作份额。骨干服务方式B F1BC F1ΔP附带损失类型MiniMax-M3托管0.44400.43710.012531%12%GPT-4o托管0.50760.49070.007846%18%Haiku 4.5托管0.44180.42550.002443%11%Sonnet 4.5托管0.42390.40750.000247%9%Qwen2.5-7B本地0.41040.3706-0.010255%37%Gemma-2-9B本地0.43050.3834-0.022669%35%Mistral-7B本地0.42550.3663-0.029869%33%VI-C RQ3: 错误在分类法中的分布如何每个验证器动作都被写入一个JSONL日志并用附录表G2中引入的分类类别之一标记。表IV报告了两个基准上的分布。该分布是配置相关的但这种相关性本身是有信息的而非省略该表的理由因此我们报告两个基准并解释差异。表IV错误分类法分布。计数是验证器动作而非三元组单个三元组可能产生多个动作。十四个声明类别中有七个在基准规模上触发其余的在附录表G2中列出。类别CTI-Nexus (149文档)CTIKG (255句)置信度降低716 (67.0%)173 (31.5%)不可能类型对104 (9.7%)72 (13.1%)修复的标识符104 (9.7%)23 (4.2%)─ 方向交换5812─ 标识符/关系4611类型误分配75 (7.0%)162 (29.5%)通用占位符38 (3.6%)96 (17.5%)自环17 (1.6%)12 (2.2%)幻觉实体15 (1.4%)12 (2.2%)总动作数1,069550触及的源146 / 149193 / 255按动作类型标记Flagged843 (78.9%)443 (80.5%)拒绝Rejected122 (11.4%)84 (15.3%)修复Repaired104 (9.7%)23 (4.2%)四个发现随之而来。首先验证器主要是一个分级标注器而非硬性门控其78.9%和80.5%的动作是软标记而直接拒绝仅为11.4%和15.3%。置信度降低占主导地位因为LLM引用的证据跨度通常仅部分支持预测的三元组以降低的置信度保留这些三元组保留了二值接受/拒绝分类器会丢弃的图效用。这是一个刻意的设计点我们明确说明因为“验证”一词会引发相反的理解。其次分布在不同基准之间显著变化并且这种变化追踪输入长度。长的CTI-Nexus报告以置信度降低为主67.0%其中部分证据对齐是反复出现的失败。短的CTIKG句子在类型误分配29.5%和通用占位符17.5%上分布因为单个句子为类型化提供的上下文很少并且经常以代词方式引用实体。将此验证器移植到新语料库的从业者应预期主导类别会跟随输入粒度而非保持不变。第三十四个声明类别中只有七个在任一基准上触发其余的是解析器或别名表较早解决的保护条件或者是声明但未达到的。附录表G2给出了完整集合。我们报告观察到的分布而非声明的分布。发现7错误分类法是对已采取动作的普查而非对存在错误的普查。 一个错误分类法容易让人读作对所发生错误的完整说明。事实并非如此并且差距双向存在。修复的标识符标签聚合了三种机制其104个CTI-Nexus动作中的58个是主语-宾语方向交换而非标识符规范化CTIKG上23个中的12个因此我们给出了细分。类型检查同样在结构上是部分的约束表拒绝不可能的对而不仅仅是错误的对标记了75个误分配而实体类型与黄金不一致的有600个——大约每八个中有一个。该层的保证是来源provenance而非完整性将表IV当作完整错误普查的读者会高估两者。VI-D RQ4: CTIForge与先前系统相比如何在单个匹配器而非每个系统自身的匹配器下评分CTIForge和CTIKG位于同一曲线的两端CTIForge在约57%的三元组数量上更精确0.5722对0.5122CTIKG在召回率上达到更高的F10.590对0.501。哪个点更优取决于下游任务。有指导意义的数字不是这两者中的任何一个CTIKG自身报告的精确率0.9189超过其统一协议精确率35个点以上完全是因为其已发布的匹配器比我们的更宽松。附录L给出了完整比较。匹配骨干比较。 消除骨干混淆因素预期能确定哪个流水线更好。然而它并没有原因是有启发性的。在相同底层模型上重新运行两个系统在所有149份文档上CTI-Nexus以0.057的三元组F1领先0.4877对0.5449完全由召回率驱动——它发出2,092个三元组对1,436个——而CTIForge保持了4.4个百分点的精确率优势。遵循第六节-A我们不将这种规模的差距在单个协议下解读为排名这也是完整比较放在附录J而非此处的原因。在限定条件下仍然成立的差距是与模式无关的指标在STIX 2.1一个两个系统都不强制的外部词汇表下CTIForge达到0.705的关系合规性而CTI-Nexus为0.573并且每个发出的三元组都带有一个源句子因为Triple模式要求一个而CTI-Nexus根本不发出证据字段。这是一个任何匹配器选择都无法影响的合约差异。VI-E RQ5: 什么限制了进一步的改进阅读表II中的完整流水线数字和表J1中的同骨干比较可以识别出将当前流水线与更高的端到端三元组F1分开的三个具体瓶颈。瓶颈1关系标注而非实体识别。 S-O对F1达到0.5309而三元组F1为0.4749。流水线识别关系参与者比标注关系更可靠。两个机制对此有贡献CTI-Nexus金标准使用自由格式关系字符串必须规范化为12个关系的清单并且相当一部分会坍缩为兜底类型语义上相邻的预测usesvsexploitsdeliversvsdrops未能被一致消歧。在CTIKG上影响更大其自由文本金标准将严格F1驱动至0.0568——这是本体映射的属性而非关系质量也是我们在此处以宽松匹配作为头条指标的原因。在匹配骨干下与CTI-Nexus的剩余差距同样由召回率主导并且是显著性过滤、证据拒绝和跨块去重按设计抑制边缘三元组的综合效果。瓶颈2实体类型化是最弱的局部组件。 准确率为0.5479。错误集中在反复出现的边界案例上——编程语言被标记为Tool而非Software威胁行为体名称被标记为Organization而非ThreatActor——而在此语料库上本体引导的分配报告了显著更高的数字 [40]。发现8精确率对骨干不敏感召回率则不是。 一个较弱的提取器可能预期会均匀地降低流水线性能但这两个量在七个测试骨干上分开了表III。未经验证的精确率仅跨八个点所有三个离线骨干都在上半区附录表F1。召回率更明显地区分了各组离线模型占据底部并且彼此之间在一个点之内。图F1将这种差异按比例呈现。在任何骨干内每文档F1的四分位距都是托管组和离线组均值之间差距的数倍。召回率在托管模型中也变化更大这表明流水线的显著性上限、证据拒绝、去重和每块预算在该机制下成为限制因素。测试的免费层骨干以零成本重现了本文的定性结论而完全离线配置在最强测试配置下方约0.11 F1处仍然可行。VI-F RQ6: 流水线的运行成本是多少发现9符号层不是消耗时间的主要部分。 在相同的基准、骨干和端点上CTIForge大约在CTI-Nexus三分之二的挂钟时间内完成。节省来自架构CTIForge每块进行一次LLM调用而CTI-Nexus使用多阶段提示流水线。验证、规范化和融合在本地运行成本可忽略不计这也使得共享提取消融成为可能。附录K给出了计时。VII 讨论最强支持的结果是评估协议既改变得分幅度也在某些比较中改变系统排序因此下面的组件发现应被解读为条件测量而非新的通用排名。符号层实际做了什么。 表IV纠正了对“验证”的自然误读大约五分之四的已记录动作是软标记。因此该层主要是一个分级标注器记录为什么一个三元组可疑而非将其丢弃的门控。表III进一步表明其价值取决于被标注的输出测试的托管配置以召回率换取精确率而测试的离线配置损失了精确率且主要移除了正确的三元组。对于面向分析师的图这一结果有利于分级而非门控因为部分正确的三元组可能保留有用的结构。该层不保证幸存的三元组是正确的它保证每个三元组都有一个源句子、验证状态和规则记录。ANCHOR [40] 通过SHACL强制一致性TACTIC-KG [41] 通过学习验证器CRUcialG [54] 通过可以修复关系的攻击合理性检查。在被检查的工件中我们没有找到等效的分类每条三元组记录一个验证器标签本身并不能标识产生它的约束。局限性。 在匹配骨干下CTIForge落后于面向召回率的CTI-Nexus流水线0.057个三元组F1差距完全在召回率上。提高显著性上限或放宽证据拒绝可能会改变这种权衡但我们没有测试这些干预措施。将自由文本金标准映射到12个关系也是有损的在CTIKG上最为明显严格F1为0.0568这就是我们在那里报告宽松匹配的原因。规范化可以改善图的可用性同时改变严格F1因为黄金标注保留了它重写的表面形式。共享提取设计在依赖于每个骨干的一个固定预测集时隔离了下游模块它不估计生成间方差。因此Sonnet和Haiku接近零的变化是描述性的而非稳定的效果估计。我们也没有建立软标记经过校准的结论它记录的是哪个规则被触发而非正确性的实测概率。最后ATTCK接地仅覆盖Technique实体——最佳测试的开源LLM达到0.22的微平均F1 [23]——并且跨文档融合虽已执行但未进行基准测试。两者都需要我们尚未构建的精选评估集。赋能下游防御。 由于每条边都带有来源图可以导出为STIX并无损地交换其来源验证状态支持分级处理——在置信度重要时过滤到未修复、证据对齐的边在覆盖度重要时允许标记的边。多报告聚合将技术提取提高约26% [24] 的证据表明融合是未实现价值最多的地方。采样温度正在变得不可观察。 跨托管端点匹配解码设置曾经是常规的簿记工作现在已不是。我们筛选的几个前沿端点无法与保留的托管运行使用的0.1温度匹配一个供应商的当前层级拒绝接受该参数已弃用另一个接受它但应用得非常弱以至于在相同提示上的重复调用仅重现了不到五分之二自身的三元组而第三个拒绝除其默认值之外的任何值。我们排除了这些托管骨干而不是报告一个无法陈述其采样条件的分支。这是第六节-A关注点的一个更低层级——那里未声明的自由参数是预测如何评分这里是如何生成——记录一个端点未遵守的温度的配置文件比记录空值更糟糕。VIII 建议对测量工具的批评只有在说明应如何改变做法时才是有用的。以下建议是基于所测量缺陷的循证实践并非保证每个数据集或系统都会表现相同。我们的结果支持四项更改均不需要新的标注。VIII-A 对于报告结果的研究人员R1. 在文档内进行匹配作用域。 在匹配前将语料库池化为扁平的预测和黄金列表允许将一份报告中的预测记入另一份报告的标注。在我们的基准上这使真正例膨胀了6.4%并且结果表中没有任何内容能揭示这一点。几个公共执行工具这样做。我们自己的工具也曾这样做悄无声息直到我们审计了它。R2. 报告一个范围而非一个点。 单一F1既掩盖了四十五个系统排序中有十一个在不同协议下翻转的事实也掩盖了一个固定预测集在协议间跨越0.54 F1的事实图3(b)。报告一个协议范围只需一个表格我们给出了我们的而非仅仅规定它。R3. 按它们所支持的主张分离指标。 针对系统自身模式评分的数字是定义性的——系统在提取时强制实施该模式不可能在该模式上得分低——并且不能用于对不共享该模式的系统进行排名。将它们与模式无关的度量如STIX 2.1词汇表合规性分开可以防止一致性结果被误读为竞争性结果。知识图谱社区已经以这种方式分离质量维度 [50]建议是引入该规程而非发明它。R4. 精确陈述匹配规则以达到可重新实现的程度。 我们仅能从其出版物中重建十二个被检查规则中的五个表I。没有编码器和阈值的“语义匹配”不是规范并且下游比较会继承该模糊性除非它定义一个新规则。发布工件并不能替代陈述规则在应用安全会议过去的十一年中ACSAC在其评估委员会中达到90%的工件参与率而其中只有40%的工件实际运行 [55]。在精确匹配确实不适合生成式输出的地方像GenRES [19] 这样的多维协议优于未指定的相似度因为它至少可以被重新实现。VIII-B 对于选择工具的从业者R5. 将单一的已发布F1视为不确定性的下界而非测量值。 该文献中两个系统之间的差距通常小于同一系统在不同协议下显示的差距。在采购决策依赖于此类比较的情况下至少使用两种协议在您自己的文档上对候选者进行重新评分。R6. 优先选择携带每条边来源的工件。 无论分数如何引用产生它的句子的边可以被必须基于其行动的 Analyst 验证不这样做的则不能。此属性与匹配器无关并且在任何协议更改后仍然成立。IX 结论与未来工作CTI知识图谱结果不能与产生它们的协议分离。重新评分表明报告的数值大小和系统排序都可能随匹配器改变而外部人类校准揭示了每个测试的机械家族都存在显著差距。因此匹配规则应该是显式的、文档作用域的并作为范围而非单一未加解释的F1报告。共享提取消融增加了第二个教训确定性规则在七个部署配置中的迁移并不统一。它们的符号分裂和不同的类型动作份额与模式约定不匹配一致但并未将服务隔离为其原因。确定性的和与模型无关是不同的属性。外部校准集界定了匹配器家族而非在域内测量CTI三元组等价性一个多重标注的CTI集仍然是必要的。我们发布了流水线、配置、评分套件、消融工具和每条三元组记录以便报告的测量可以被检查和重新评分。
返回列表