ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

给 OpenCode/Claude Code/ZCode 装上“眼睛”:image-vision Skill 一键安装教程,让 DeepSeek 等纯文本模型也能看图

给 OpenCode/Claude Code/ZCode 装上“眼睛”:image-vision Skill 一键安装教程,让 DeepSeek 等纯文本模型也能看图 1. 纯文本模型看不了图这个痛点怎么破如果你正在用 OpenCode、Claude Code 或者 ZCode 搭 AI 编程环境大概率会选一套「强 Harness 高性价比纯文本模型」的组合。Harness 负责工具调用、文件读写、终端执行模型负责推理和写代码。DeepSeek、GLM、Kimi 这类模型编码能力扎实按量计费成本又低作为日常开发底座确实香。但这套组合有个绕不开的短板这些模型没有多模态能力看不了图片。你贴一张报错截图过去它只会回你「抱歉我无法查看图片」你把设计稿拖进对话它照样一脸茫然。结果就是遇到前端还原、UI 走查、报错定位这类需要「看图」的场景你还是得手动把图里的信息一个字一个字敲成文字再喂给模型。image-vision Skill 解决的正是这个问题。它的思路很直接不换主模型在主模型之外挂一个视觉模型当「眼睛」。你上传图片后Skill 自动调用一个零依赖的 Python 脚本把图片做 base64 编码通过 OpenAI 兼容接口发给视觉模型拿到文字描述后再回灌给主模型继续推理。全程对用户透明就像模型本来就能看图一样。这套方案适合谁三类人最受益。第一类是用 OpenCode / Claude Code / ZCode 做日常开发、但主模型是纯文本的开发者第二类是想在多个 AI 编程工具之间混用、不想为每个工具重复配置识图能力的人第三类是手头有 OpenAI 兼容的视觉模型接口比如通义千问 Qwen-VL、智谱 GLM-4V、SiliconFlow或者本地 vLLM / Ollama想直接复用的人。一份 Skill四个平台通用换视觉厂商只改配置三行代码一行不动。下面我按「前置准备 → 安装 → 配置 → 验证 → 排障」的顺序把整套流程拆成可复制的步骤。你跟着做十分钟内能让 DeepSeek 这类纯文本模型「看见」图片。2. 前置准备TaoToken 统一 Key 与 API 通道在装 Skill 之前先把「视觉模型从哪来」这件事定下来。image-vision 的配置只需要三项API 地址、API Key、模型名称。这三项指向一个 OpenAI 兼容的视觉模型接口即可。如果你还没想好用哪家视觉模型可以用 TaoToken 作为统一入口。它的好处是一个 Key 打通多个模型通道视觉模型和文本模型走同一套鉴权省得你在不同厂商控制台之间来回切换。官网地址是 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content API 基址是 https://taotoken.net/api 。具体操作分两步。第一步登录后在控制台创建 API Key拿到一串sk-开头的密钥。第二步确认你要用的视觉模型名称。TaoToken 的模型列表里视觉模型通常带-vl、-vision或-4v之类的后缀选一个你需要的记下来。注意API 基址填https://taotoken.net/api即可不要在后面手动加/v1脚本会自动拼接兼容路径。如果你用的是其他厂商按其文档填完整的兼容模式地址比如通义千问是https://dashscope.aliyuncs.com/compatible-mode/v1。拿到这三项后先别急着装 Skill可以先用一条 curl 命令确认通道是通的curl https://taotoken.net/api/v1/chat/completions \ -H Authorization: Bearer sk-你的Key \ -H Content-Type: application/json \ -d { model: 你的视觉模型名, messages: [{role: user, content: 你好}] }返回里有choices字段就说明 Key 和地址没问题。这一步能帮你把「配置错误」和「Skill 安装错误」提前分开后面排障会省很多事。3. 可复制配置三种安装方式与 settings.json / config.toml 骨架image-vision 的安装有三种方式从懒人到手动按你的习惯选一种就行。3.1 最省事让 AI 自己装打开你的 OpenCode / Claude Code / ZCode 对话把下面这句话原样扔进去按 https://github.com/wangxintai929/image-vision-skill 的 README 帮我配置识图能力全局安装AI 会自动完成下载、安装、写配置并根据你的回答填入视觉模型参数。看到「配置检查通过」就完成了。如果访问 GitHub 网络不畅可以在仓库页面点 Code → Download ZIP解压到本地后对 AI 说安装 D:\Job\code\image-vision-skill-main把路径换成你的实际解压目录后续步骤完全一样。加不加「全局安装」有区别不加只在当前项目/会话生效加了之后所有会话都能用推荐全局。3.2 一键安装脚本所有平台通用git clone https://github.com/wangxintai929/image-vision-skill.git cd image-vision-skill ./install.sh # macOS / Linux # Windows: powershell -ExecutionPolicy Bypass -File install.ps1脚本会自动完成四件事复制脚本到统一目录~/.config/image-vision/各平台共用一份、生成config.json、把 Skill 装到 OpenCode 和 Claude Code 的 skills 目录、执行配置检查。3.3 手动安装与各平台目录对照下载 ZIP 解压后把SKILL.md复制到对应平台的 skills 目录平台安装位置OpenCode~/.config/opencode/skills/image-vision/Claude Code~/.claude/skills/image-vision/SKILL.mdZCode~/.zcode/skills/image-vision/SKILL.mdCodex无 Skill 机制在~/.codex/AGENTS.md追加指令兜底注意ZCode 不扫~/.claude/skills/必须放到自己的~/.zcode/skills/下这是最容易踩的坑。3.4 配置文件骨架OpenCode 的opencode.json全局在~/.config/opencode/opencode.json也可放项目内加入远程加载{ skills: { urls: [https://cdn.jsdelivr.net/gh/wangxintai929/image-vision-skillmain/] } }重启 OpenCode 后会自动从 CDN 拉取 Skill 和脚本仓库更新后重启即拉新版连文件都不用复制。Claude Code 的settings.json里如果要放行识别命令免确认加一行{ permissions: { allow: [Bash(python:*vision.py*)] } }OpenCode / ZCode 则在opencode.json里加{ permissions: { *vision.py*: allow } }视觉模型的三项参数写在~/.config/image-vision/config.json里骨架如下{ api_base: https://taotoken.net/api, api_key: sk-你的Key, model: 你的视觉模型名 }如果你更习惯 TOML 风格部分平台支持config.tomlapi_base https://taotoken.net/api api_key sk-你的Key model 你的视觉模型名两种格式二选一脚本会优先读config.json。改完配置后重新跑一次配置检查即可。4. 验证请求上传图片确认识图链路打通装好之后别急着在对话里贴图先用命令行单独验证一次把 Skill 层和模型层分开确认。准备一张测试图比如一张报错截图或设计稿放到当前目录命名为test.png。然后执行python ~/.config/image-vision/vision.py test.png -q 图片里有什么正常情况几秒到十几秒会返回一段文字描述。如果返回了内容说明「脚本 → API 通道 → 视觉模型」这条链路是通的。接着回到 OpenCode / Claude Code / ZCode 对话里直接拖一张图进去问「这张图里报了什么错」主模型会自动触发 Skill把图转成描述后继续推理。实测下来报错截图、设计稿、多图对比这几类场景识别都比较准。多图对比时可以一次传多张脚本会逐张处理再汇总。如果你用的是 TaoToken 通道验证模型对话能力可以直接在模型对话页里试https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。把同一张图传进去对比一下 Skill 返回的描述和模型对话页的直接识图结果能帮你判断是脚本配置问题还是模型本身的问题。5. 本篇常见错排查装 Skill 这件事报错基本集中在四类。我把踩过的坑按现象、原因、解法列出来你对号入座。现象一对话里贴图模型还是回「我无法查看图片」。原因通常是 Skill 没装到当前平台扫描的目录。ZCode 用户尤其容易中招因为 ZCode 不扫~/.claude/skills/。解法确认SKILL.md在~/.zcode/skills/image-vision/下然后重启 ZCode。OpenCode 用户检查opencode.json里的skills.urls是否写对重启后看日志有没有拉取记录。现象二vision.py报ModuleNotFoundError。image-vision 是纯 Python 标准库实现零第三方依赖Python 3.7 就能跑。出现这个错多半是你用了系统自带的旧 Python或者python命令指向了错误的解释器。解法用python3 --version确认版本必要时在命令里显式写python3。现象三返回 401 或 403。Key 错了或者 API 基址多写了/v1。TaoToken 的基址填https://taotoken.net/api脚本会自动拼兼容路径如果你手动加了/v1就会变成/api/v1/v1/...。解法检查config.json里的api_base去掉多余的/v1重新跑验证命令。现象四返回 404 或「模型不存在」。模型名称写错了。视觉模型和文本模型的名字不一样别把deepseek-chat填进去。解法去模型列表页确认视觉模型的准确名称复制粘贴注意大小写和后缀。现象五命令执行时弹确认每次都要点。这是权限配置没放行。解法按第 3.4 节的骨架在settings.json或opencode.json里加*vision.py*的 allow 规则其余命令仍保持确认安全性和便利性兼顾。排障时如果怀疑是接入层的问题可以对照接入文档逐项核对https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。文档里有完整的请求示例和错误码说明比盲猜快得多。6. 长期编码与 Agent 场景的接入建议如果你只是偶尔贴张图上面这套配置就够了。但如果你打算把 OpenCode / Claude Code / ZCode 当成长期编码和 Agent 底座建议把 Key 管理也一并理顺。长期跑 Agent 的话请求量会比手动对话大不少Key 的额度和计费要提前规划。TaoToken 的 Coding Plan 适合这种持续调用的场景一个 Key 覆盖文本和视觉模型不用为识图单独再开一个厂商账号https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。Key 的创建和管理在控制台的 API Keys 页面https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。建议给编程工具单独建一个 Key方便按工具维度看用量出问题也好定位。最后补一句实操经验image-vision 的配置检查通过后把~/.config/image-vision/这个目录加进你的 dotfiles 备份。换机器时只要恢复这个目录再改一下 Key四个平台的识图能力就全回来了不用重新装一遍。
返回列表