ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

(论文速读)LogSAD:无需训练的结构异常与逻辑异常统一检测

(论文速读)LogSAD:无需训练的结构异常与逻辑异常统一检测 论文题目Towards Training-free Anomaly Detection with Vision and Language Foundation Models迈向基于视觉与语言基础模型的免训练异常检测会议CVPR 2025摘要异常检测在工业质量检测等真实场景中具有重要价值但现有方法大多聚焦局部结构异常而忽略带有逻辑约束的组合异常。本文提出 LogSAD一个同时面向 Logical Anomaly Detection 与 Structural Anomaly Detection 的免训练多模态框架。作者首先提出 Match-of-Thought利用 GPT-4V 生成匹配提案形成关注对象与组合规则随后设计 patch、interest set、composition 三种粒度的异常检测器最后对不同检测器的异常分数进行校准与融合。LogSAD 在无需额外训练的情况下统一处理逻辑异常与结构异常并在多个工业异常检测基准上取得具有竞争力的结果。源码GitHub - zhang0jhon/LogSAD: [CVPR 2025] Towards Training-free Anomaly Detection with Vision and Language Foundation Models · GitHub一、研究背景与核心问题工业异常检测里最常见的是Structural Anomaly划痕、破损、污染、凹坑等局部外观变化。这类异常往往可以通过 patch 特征与正常样本做匹配来发现。但Logical Anomaly不一样。局部外观可能完全正常真正错误的是数量、属性、位置或关系例如果汁颜色与标签不匹配、pushpin 数量错误、连接器左右不对称、线缆颜色与卡扣数量不符合规则。论文 Figure 1MVTec LOCO 中 Structural Anomaly 与 Logical Anomaly 的区别。MVTec Loco数据集中结构和逻辑异常的例子。组合多模式特征匹配在统一异常检测中起着至关重要的作用特别是在有效地识别和分类逻辑异常方面。Figure 1 说明结构异常主要是局部视觉变化而逻辑异常更像“组合关系违反规则”。因此仅靠局部特征相似度很难统一覆盖两类问题。LogSAD 的思路是让 CLIP、DINOv2、SAM 提供视觉与语义基础能力让 GPT-4V 把自然语言约束转换为可执行规则再在不同粒度上完成匹配。二、整体框架Match-of-Thought 多粒度检测论文 Figure 2LogSAD 整体框架LogSAD 可以看成四个阶段Multi-modal Inputs → Foundation Models → Multi-granularity Anomaly Detectors → Decision。输入包含少量正常图像和文字逻辑约束基础模型包括 SAM、CLIP 和 DINOv2中间由三个检测器组成Patch Matching、Interest Matching、Composition Matching最后通过 Calibration 与 Fusion 得到最终异常分数。三个检测器分工明确Patch Matching关注局部结构变化Interest Matching比较语义对象集合Composition Matching检查数量、属性、对应关系、对称性等逻辑约束。LogSAD 不是让单个模型承担所有异常而是把不同类型的异常分配给最合适的粒度。三、Match-of-Thought把文字规则“编译”为匹配规则逻辑异常的规则通常写在人类语言里。例如 Splicing Connectors 要求左右连接器拥有相同数量的 clamps只由一根 cable 连接clamp 数量与 cable 颜色有对应关系线缆两端还要保持镜像对称。直接让大模型回答“这张图是否异常”容易受到计数、空间关系和幻觉问题影响。因此作者提出Match-of-ThoughtMoTGPT-4V 不直接输出最终异常结论而是负责 prompt engineering 和 match engineering。论文 Figure 3Splicing Connectors 上的 Match-of-Thought 示例MoT 输入正常图像和文字约束输出anomaly-free image captions、interests of thought、compositional rules of thought。例如 Interests 包括 splicing connector、cable、grid组合规则则被拆成 cable count、左右 clamp 对称、clamp 数量与 cable 颜色对应等条件。换句话说GPT-4V 在这里更像一个“规则编译器”把抽象自然语言约束整理成后续检测器可以执行的匹配提案。四、三个粒度的异常检测器4.1 Patch Matching检测局部结构异常作者从 CLIP 和 DINOv2 的多层 backbone 提取 patch features并从正常图像建立 memory bank。测试 patch 与正常 patch 做余弦距离最近邻搜索某个局部区域如果与所有正常 patch 都不相似就得到较高异常分数。这一分支主要负责划痕、破损、污渍等结构异常。4.2 Interest Matching从 patch 升级到对象集合作者使用 MoT 产生的 interests 作为文字提示结合 CLIP 和 SAM 做 open-vocabulary segmentation再把同一 interest 的 masked patches 聚合成对象级特征。测试图像得到 interest set (P)正常参考得到 (Q)随后通过 Hungarian Algorithm 求最小代价二分图匹配pair-wise cost 为这样模型比较的不再只是局部 patch而是“对象集合能否与正常对象集合合理对应”因此更容易发现对象缺失、数量变化或对象级错位。4.3 Composition Matching显式检查逻辑约束MoT 已经把正常逻辑写成规则 (R)SAM/CLIP 再提供相关视觉对象 (V) 和文本属性 (T)。Composition Matching 判断当前图像是否满足规则例如 Juice Bottle 中可以检查“液体颜色—水果标签”是否合法如果属性组合不属于正常规则集合就直接判为逻辑异常。三个分支的分数经过校准后取最大值作为最终异常分数。其含义很直观只要任一粒度发现明显异常就保留该异常信号。五、实验结果与消融分析实验覆盖 MVTec LOCO、MVTec AD 和 VisA。模型使用 CLIP ViT-L/14、DINOv2 ViT-L/14 和 SAM ViT-H/16输入分辨率为 448 × 448LogSAD 本身不训练额外检测网络。5.1 MVTec LOCO统一结构异常与逻辑异常论文 Table 1MVTec LOCO 上的统一异常检测结果Full-data 下LogSAD 的平均 image-level AUROC 为90.24-shot 下仍达到86.3。由于它属于 training-free 方法这一结果说明视觉基础模型与显式逻辑规则可以在不重新训练模型的情况下完成统一异常检测。论文 Table 21-shot、2-shot、4-shot Few-Shot 结果LogSAD 在 1/2/4-shot 下分别达到78.5、82.1、86.3平均82.3PromptAD 对应为 71.2、72.6、73.5。随着正常图像增加patch 与 interest 参考更充分性能持续提升。论文 Table 3Logical 与 Structural anomaly 分开评估LogSAD 在 Logical / Structural 上分别达到89.3 / 93.1平均 91.2。EfficientAD 为 86.8 / 94.7说明 LogSAD 对逻辑异常尤其有效同时结构异常能力仍保持较高水平。PSAD 的 Logical AUROC 更高但它额外使用 segmentation annotations 训练因此论文没有将其作为同条件对比。5.2 MVTec AD 与 VisA论文 Table 4MVTec AD 与 VisA 的 Few-Shot 结果MVTec AD 上LogSAD 4-shot 的 image/pixel AUROC 为97.0/97.6VisA 上为93.0/98.1。这说明加入逻辑检测机制后框架仍然可以处理传统结构异常。5.3 MoT 最终生成了什么论文 Table 5MVTec LOCO 五个类别的 Interests 与 Compositional RulesTable 5 给出了每个类别的语义对象和规则Breakfast Box 检查不同食材的比例与位置Pushpins 检查数量是否为 15Screw Bag 检查不同零件数量组合Splicing Connectors 同时检查 cable color、clamp number、左右对称和端点位置。这说明 LogSAD 不是用统一 prompt 粗略判断所有类别而是显式描述每类正常逻辑。5.4 三种检测器分别解决什么问题论文 Table 6Patch / Interest / Composition 三种检测器的独立能力Full-data 下Patch detector 的 Structural AUROC 为93.1Logical 只有 71.8Composition detector 的 Structural 为 58.0但 Logical 达到78.2Interest detector 为 81.7 / 80.6。结果直接验证了三个粒度的分工Patch 擅长结构异常Composition 更适合逻辑异常Interest 连接两者。论文 Table 7检测器校准与融合消融单独使用一个分支时F1-max/AUROC 约为 81三个检测器全部融合后达到88.8 / 90.2说明多粒度检测器确实具有互补性。5.5 为什么不直接让 LMM 判断异常论文 Figure 4MVTec LOCO 上的开放词汇语义分割结果Figure 4 显示正常和异常样本中的 interest 对象都能被较准确地分割这是 Interest Matching 和 Composition Matching 的基础。论文 Figure 5LogSAD 与 LLaVA、Mini-Gemini 的组合推理对比LMM 可以回答一些简单属性问题例如 cable color但在 pushpin 计数、左右 clamp 数量等任务上容易出错。LogSAD 不让 LMM 做最终计数而是先获得视觉 atoms再按显式规则检查。例如检测到 16 个 pushpins而正常规则要求 15 个就直接得到 ()。这也解释了 Match-of-Thought 的定位大模型擅长整理规则但复杂视觉组合推理仍交给显式匹配过程。六、总结与思考LogSAD 的核心价值是把异常检测拆成三个层次局部 patch 是否异常、对象集合是否异常、对象之间的逻辑关系是否异常。Match-of-Thought 负责把自然语言约束转成 interests 与 compositional rulesCLIP、DINOv2、SAM 提供已有视觉与语言能力Patch、Interest、Composition 三个检测器各自处理不同粒度的问题最后进行分数校准与融合。整个流程不需要重新训练检测网络。论文也指出其局限Composition Matching 依赖 open-vocabulary segmentation 的准确性复杂场景下仍有提升空间。未来工作将继续增强开放词汇语义分割并探索更强的 LMM。如果把整篇论文压缩成一句话LogSAD 不让大模型直接“看图判异常”而是让大模型把逻辑规则整理出来再让视觉基础模型在 patch、object set 和 composition 三个粒度执行匹配从而用一个 training-free 框架统一结构异常与逻辑异常检测。
返回列表