ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

CLIP 模型卡全解析:架构、能力边界与安全使用指南

CLIP 模型卡全解析:架构、能力边界与安全使用指南 人工智能基础模型大模型多模态计算机视觉【免费下载链接】CLIPCLIP (Contrastive Language-Image Pretraining), Predict the most relevant text snippet given an image项目地址https://gitcode.com/GitHub_Trending/cl/CLIP点击查看免费下载本篇指南以 OpenAI 官方发布的 model-card.md 为骨架结合本仓库 clip/model.py、clip/clip.py 等源码系统拆解 CLIPContrastive Language-Image Pre-Training多模态模型的模型细节、发布版本、预期用途、训练数据、性能表现与已知局限。读完本文你将能够正确评估 CLIP 在零样本图像分类研究中的适用场景理解其类目设计敏感性带来的公平性风险并掌握部署前必须进行的领域内测试要求。一、模型详情CLIP 是什么CLIP 由 OpenAI 的研究者开发核心目标是研究计算机视觉任务的鲁棒性从何而来并检验模型是否能在零样本zero-shot方式下泛化到任意图像分类任务。它并非为通用模型部署而设计——要部署类似 CLIP 的模型研究者必须先在具体部署上下文中仔细研究其能力边界。从实现看仓库中的 CLIP 类 是一个双编码器结构图像编码器 文本编码器两者通过对比损失contrastive loss联合训练目标是最大化 (image, text) 匹配对的相似度。这正是 README.md 中所述通过自然语言指令给定一张图片预测最相关文本片段能力的来源。模型日期2021 年 1 月。模型类型基础模型使用经过多处修改的 ResNet50作为图像编码器使用带掩码自注意力的 Transformer作为文本编码器。此外还有将 ResNet 图像编码器替换为 Vision TransformerViT的变体。从 model.py 的ModifiedResNet类可以看到与 torchvision 标准 ResNet 的三大差异三段式 stem原来 1 个卷积改为 3 个卷积且用平均池化替代最大池化抗混叠步长卷积当卷积 stride 1 时先在前面接一个平均池化见Bottleneck中的avgpool注意力池化最后一层池化改为 QKV 注意力AttentionPool2d见 model.py而不是平均池化。模型版本官方分阶段发布了多组模型按发布时间线整理如下发布时间模型版本架构说明初始发布ViT-B/32、RN50分别对应 Vision Transformer 与 ResNet-50 架构随阶段发布RN101、RN50x4RN50x4 按 EfficientNet 缩放规则放大 4 倍2021 年 7 月RN50x16、ViT-B/16—2022 年 1 月RN50x64、ViT-L/14—2022 年 4 月ViT-L/14336px336 像素输入分辨率的 ViT-L/14这些版本名与 clip/clip.py 中_MODELS字典的键完全对应clip.available_models()返回的正是这 8 个模型名。ViT-B/32中的32表示 patch size336px表示输入分辨率其余 ViT 模型默认输入 224×224。相关文档Blog PostCLIP Paper二、模型用途预期场景与越界场景预期用途该模型定位为面向研究社区的研究产出。官方希望它帮助研究者理解并探索零样本、任意图像分类同时支持对这类模型潜在影响的跨学科研究论文中包含了对潜在下游影响的讨论示例。主要预期用户是 AI 研究者主要用途是理解视觉模型的鲁棒性、泛化能力以及其他能力、偏见和约束。越界使用场景模型卡对越界场景的界定非常严格任何部署场景无论商业与否目前均属越界受约束环境下的非部署用例如受限环境中的图像搜索除非用特定的、固定的类目体系做了彻底的领域内测试否则也不推荐安全评估表明鉴于 CLIP 在不同类目体系下性能波动显著任何未经测试、不受约束的部署都可能造成潜在危害监控surveillance与人脸识别类用例无论模型表现如何都始终越界——此类 AI 应用目前缺乏公平使用的测试规范和检查机制模型未针对英语以外的语言进行专门训练或评估使用应限于英语场景。这一研究优先、部署审慎的边界与 model-card.md 开篇不是为通用部署开发的定位一致。三、训练数据公开图文对与数据使命数据来源模型在公开的图像-标题image-caption配对数据上训练数据通过两种途径获得爬取少数几个网站使用已有的常用图像数据集如 YFCC100M见 data/yfcc100m.md。其中很大一部分来自互联网爬取因此数据对与互联网连接最密切的人群和社会更有代表性——这往往偏向发达国家、年轻人和男性用户。数据使命声明构建该数据集的目标是检验视觉任务的鲁棒性和泛化性因此重点是从不同公开互联网数据源收集大量数据采集过程基本采取非干预式non-interventionist方式。不过爬取时只选择有政策禁止过度暴力和成人图像、且允许过滤此类内容的网站。关键约束该数据集不打算作为任何商业或部署模型的基础官方也不会发布该数据集。四、性能表现与局限性性能评估CLIP 在大量计算机视觉基准上接受过评估覆盖从 OCR、纹理识别到细粒度分类的广泛任务。论文中报告的评估数据集包括细粒度与通用图像分类Food101、CIFAR10、CIFAR100、Birdsnap、SUN397、Stanford Cars、FGVC Aircraft、VOC2007、DTD、Oxford-IIIT Pet dataset、Caltech101、Flowers102、STL-10、ImageNet。OCR 与字符识别MNIST、SVHN、IIIT5K、Flickr30。地理定位与计数Country211、CLEVR Counting、KITTI Distance。鲁棒性基准ImageNet-A、ImageNet-R、ImageNet Sketch、ObjectNet (ImageNet Overlap)。视频与多模态UCF101、Kinetics700、Youtube-BB、ImageNet-Vid。社会影响类Hateful Memes、SST-2、RareAct、MSCOCO。其中 Country211 是专门用于评估地理定位能力的基准从 YFCC100M 中筛选出带 GPS 坐标对应 ISO-3166 国家代码的图像为每个国家采样 150 张训练图、50 张验证图、100 张测试图构建均衡数据集详见 data/country211.md。此外data/prompts.md 提供了论文中用于收集零样本分类分数的 26 个数据集的类名与提示模板如 CIFAR10 的 18 个模板、Caltech101 的 34 个模板ImageNet 的提示工程方案则记录在 notebooks/Prompt_Engineering_for_ImageNet.ipynb 中。已知局限模型卡明确列出了 CLIP 的若干局限细粒度分类与物体计数CLIP 在这两类任务上表现挣扎公平性与偏见问题论文中有专门讨论评估方法的低估风险许多情况下官方使用线性探针linear probe评估 CLIP而有证据表明线性探针可能低估模型真实性能。关于第三点仓库中的 tests/test_consistency.py 恰好展示了另一种评估思路它同时加载 JIT 版本与非 JIT 版本模型断言两者在相同输入上的 softmax 概率在atol0.01, rtol0.1容差内一致验证了两种加载路径的输出一致性——这也说明在正式评估前先确认推理管线本身的确定性是必要的。偏见与公平性模型卡披露了针对 Fairface 数据集的系统性测试污名化风险测试将人物图像分类到犯罪相关和非人类动物类目时发现种族和性别方面存在显著差异且这些差异会随类目构造方式变化而改变人口统计分类测试性别分类在所有种族上准确率 96%Middle Eastern 最高 98.4%White 最低 96.5%种族分类平均约 93%年龄分类平均约 63%。需要强调的是模型卡声明这些测试只是为了评估模型在不同人群上的表现、暴露潜在风险绝不代表对这类任务的认可或热衷。核心结论是CLIP 的性能与具体偏见高度依赖于类目设计和类别取舍这直接呼应了前文未经测试的部署可能有害的警告。五、从模型卡到实践源码视角的关键验证为了让模型卡中的描述与本仓库实现相互印证这里补充几个源码级观测点对比学习的对数尺度CLIP.forward()中logit_scale self.logit_scale.exp()初始值为np.log(1 / 0.07)见 model.py对应 README 中余弦相似度乘以 100的表述1/0.07 ≈ 14.29exp 后约 100 量级零样本分类的标准流程加载模型后使用model.encode_image/model.encode_text提取特征归一化后计算余弦相似度这一流程在 README 的 Zero-Shot Prediction 示例CIFAR-100top-5 输出如snake: 65.31%中完整演示线性探针评估README 提供了用 scikit-learn 的 LogisticRegressionC0.316需在验证集上通过超参数扫描确定在 CLIP 图像特征上训练分类器的完整代码与模型卡中线性探针可能低估性能的讨论直接相关。六、反馈渠道关于模型的任何问题或评论官方建议通过 Google Form 提交。结语CLIP 模型卡是一份负责任模型报告的代表作它清晰划定了研究用途 vs 部署用途的边界披露了训练数据的代表性偏差量化了偏见与公平性风险也诚实记录了细粒度分类、计数等能力短板。对于任何打算在零样本分类、图文检索等方向使用 CLIP 的研究者正确理解这份模型卡意味着同时理解它的能力上限与使用红线——先做领域内测试再谈其他。赞分享人工智能基础模型大模型多模态计算机视觉【免费下载链接】CLIPCLIP (Contrastive Language-Image Pretraining), Predict the most relevant text snippet given an image项目地址https://gitcode.com/GitHub_Trending/cl/CLIP点击查看免费下载相关推荐Numba 安全模型解析JIT 编译器的信任边界与安全使用指南Numba 安全模型解析JIT 编译器的信任边界与安全使用指南 导读 Numba 是一个利用 LLVM 将 Python 函数即时编译JIT为原生机器码的编译器高性能计算FLUX.1 [dev] 模型卡片全解析12B 整流流 Transformer 的能力边界、本地推理与合规使用FLUX.1 dev 模型卡片全解析12B 整流流 Transformer 的能力边界、本地推理与合规使用 FLUX.1 dev 是 Black Forest人工智能大模型本地部署媒体生成FluentRead 油猴脚本完全指南安装、能力边界与隐私模型FluentRead 油猴脚本完全指南安装、能力边界与隐私模型 导读 FluentRead流畅阅读除了提供浏览器扩展形态还发布了一款独立的油猴User前端AI 应用本地部署上一篇Unexpected information v2.3新特性详解双向检测与灰色高亮功能实战下一篇[自定义脚本] 打造原神自动化任务开源工具Better Genshin Impact开发指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表