ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

给智能体装上“眼睛“只要 3 步:Qwen-MM-Plugins 多模态插件上手实录

给智能体装上“眼睛“只要 3 步:Qwen-MM-Plugins 多模态插件上手实录 给智能体装上眼睛只要 3 步Qwen-MM-Plugins 多模态插件上手实录【免费下载链接】Qwen-MM-PluginsMake any agent harness multimodal-native.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen-MM-PluginsQwen-MM-Plugins 是一款让智能体具备多模态原生能力的插件工具集——装上它你的 AI 助手就能直接读懂图片、看完视频、解析文档而不是对着文件束手无策。读完全文你会清楚它到底解决了什么问题、你的环境够不够、两条安装路线怎么选以及如何用一句话让助手看见第一个文件。先讲一个助手没长眼睛的故事朋友小林用 AI 助手整理资料最头疼的就是看图客户发来一张表格截图助手回复图片内容无法读取一段产品演示视频得先手动抽帧、再一张张喂给模型。折腾几次之后他一度以为 AI 助手天生没有视觉。直到他给助手装上了Qwen-MM-Plugins——事情开始变得不一样。第 1 步认识它——多模态原生到底是什么意思多模态原生听起来玄乎一句话就能讲清以前要让模型看图你得先把图片翻译成文字描述而装上这类插件后智能体自己就握着读图、读视频、翻文档的工具像人一样直接处理原始文件。这正是项目口号 Make any agent harness multimodal-native 的含义——给任何智能体套件补上多模态的底子也就是所谓的智能体接入多模态能力。它的能力按模块拆分可以按需装配模块一句话说明典型用途core全能阅读器图像识别与标注、视频读取与分析、PDF/Office 文档解析、OCR、物体定位video-memory长视频记忆库看完 2 小时讲座还能追问第 40 分钟讲了什么omni-av音视频的耳朵说话人区分、音乐标签、事件计数video-edit视频工坊按脚本剪辑、文生图、文生视频blender / freecad3D 建模与 CAD生成 3D 模型、编辑 STEP 文件、跑 FEM 分析edu-agent教学视频生成把一道数学题变成带讲解的动画视频每个模块都是技能 MCP 服务的组合技能负责告诉模型我有哪些工具MCP 服务才是真正干活的工具本体。想看实现细节核心源码在 src/capabilities/core/各模块的完整工具清单和实战案例在 cookbooks/ 里。第 2 步装好它——两条路线先对照门槛动手之前先检查环境缺了会在后面卡住系统Linux 即可Windows 用户建议用 WSL2且把仓库放进 WSL 家目录别放在 /mnt/c 这类挂载盘下能少踩很多文件权限的坑Python3.8 及以上系统工具ffmpeg视频处理与 libreoffice文档可视化。避坑提醒ffmpeg 没装视频类工具会直接罢工libreoffice 没装PDF、Office 文档的可视化也出不来。Ubuntu 一行搞定sudo apt install ffmpeg libreoffice。环境没问题后按你的智能体类型二选一。路线 A走插件市场推荐。Claude Code、Qwen Code 这类支持插件市场的智能体用引导式安装脚本最省心git clone https://gitcode.com/gh_mirrors/qw/Qwen-MM-Plugins cd Qwen-MM-Plugins bash install.sh安装器会弹出交互菜单让你勾选能力模块底层调用的是智能体原生的插件安装命令装完还会顺手跑一次系统自检。整个过程大致长这样路线 B手动注册无插件市场的环境。先用scripts/dev-install.sh core装好依赖再把技能目录软链进智能体的技能文件夹并手动注册 MCP 服务。多几步但同样可靠适合 opencode、QwenPaw 这类不走市场的环境。第 3 步跑起来——先 3 步打通 API 密钥安装只是热身真正让眼睛睁开的是一把密钥。申请密钥图像识别、OCR、语音识别等在线能力走阿里云 DashScope在控制台申请免费试用的DASHSCOPE_API_KEY即可。纯本地的读图、读视频不需要密钥这点对隐私敏感场景很友好写入配置export DASHSCOPE_API_KEY你的密钥或者用bash install.sh configure把它写进统一配置文件让 GUI 启动的智能体也能读到跑一次体检bash install.sh verify会检测密钥是否就位、系统工具是否齐全缺什么当场报给你。避坑提醒工具报错或返回空结果八成是密钥没配上。先跑一遍 verify比对着日志瞎猜高效得多。视频分析插件配置完成后调用方式简单到不像配置过的不用写代码直接在对话里 文件、说需求。想验证视频读取丢给它一段视频promo.mp4 帮我读一下这个视频说说它讲了什么它会自动抽帧、按模型的分辨率网格缩放每一帧把整段视频翻译成文字描述想验证图像识别与标注丢一张照片table.jpg 把图里的蛋糕都框出来grounding工具会返回每个物体的像素坐标再由标注工具在图上画出编号框让模型和人眼看到的是同一幅图两个高频小麻烦提前排掉视频处理偏慢默认最多抽 600 帧嫌慢就调低QWEN_MM_MAX_TOTAL_FRAMES比如 300速度立竿见影中文显示成方块装一套中文字体即可sudo apt install fonts-noto-cjk。现在轮到你让它看见了回到开头小林的困境——其实只差一次安装。Qwen-MM-Plugins 把读图、看视频、翻文档这些人类的基础技能还给了智能体而你只需要三条命令加一句对话。clone 仓库、装上 core 模块、配好密钥然后挑一个你最常处理的文件对助手说读一下这个。剩下的交给它。更详细的安装说明和各模块的深度教程都在官方文档 docs/zh/ 里等着你。【免费下载链接】Qwen-MM-PluginsMake any agent harness multimodal-native.项目地址: https://gitcode.com/gh_mirrors/qw/Qwen-MM-Plugins创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表