ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Qwen2.5-VL智能体实战指南:让模型看懂屏幕并自动操作电脑和手机

Qwen2.5-VL智能体实战指南:让模型看懂屏幕并自动操作电脑和手机 Qwen2.5-VL智能体实战指南让模型看懂屏幕并自动操作电脑和手机【免费下载链接】Qwen3-VLQwen3-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen3-VL你说把这张图存到相册AI 就真的去点了手机屏幕你说打开右边第三个 Issue它就真的挪动鼠标点了过去。这是 Qwen2.5-VL 智能体能做的 GUI 自动化你给它一张截图它输出一条 JSON 指令系统按指令去执行点击、输入和滑动。能力速览一张表看懂两个工具类能干什么功能落地在 cookbooks/utils/agent_function_call.py 里它定义了两个工具类ComputerUse管桌面MobileUse管手机。模型能发出的所有动作都在这两个类里登记过先用一张表过一遍设备与工具典型动作能完成的事桌面 · ComputerUseleft_clickdouble_clickleft_click_dragscroll打开程序、点按钮、拖文件、滚动页面桌面 · ComputerUsekeytype组合快捷键如 CtrlS、往输入框填文本移动 · MobileUseclicklong_pressswipetype点按图标、长按复制、上滑信息流、键入关键词移动 · MobileUsesystem_buttonopenwait按 Back/Home 返回桌面、按应用名打开 App、等待画面稳定两个类还各自带一个terminate报告 success 或 failure结束整段多步任务。它是循环的出口。动作清单看完了你可能会好奇模型怎么知道该点哪里原理一句话截图、理解、出指令、执行一个闭环整个过程是一个闭环每轮走四步截一张屏幕图 → 模型用视觉理解认出图里的元素和位置 → 模型生成一条 JSON 格式的函数调用里面带着动作类型和坐标 → 你在真机上执行它再截一张新图喂回模型。如此往复直到模型输出terminate才收手。关键设计在于坐标与真实分辨率解耦工具描述里告诉模型屏幕是一个 0–999 的坐标系模型照着报数你的设备实际宽多少高多少是执行端的事换算成真实像素再落点。同一套模型因此能在不同分辨率的设备上通用。快速跑通从安装到看到第一次自动操作第一步拿到仓库git clone https://gitcode.com/GitHub_Trending/qw/Qwen2.5-VL第二步装依赖和 notebook 里 Setup 单元格的命令一致pip install transformers qwen-vl-utils qwen-agent openai第三步打开示例。官方示例都在cookbooks/目录桌面端入口是 cookbooks/computer_use.ipynb在仓库根目录执行jupyter lab cookbooks/computer_use.ipynb即可。notebook 提供两条路线API 路线只需在开头单元格填上DASHSCOPE_API_KEY本地模型路线需要 GPUtorch、flash-attn 等依赖按 notebook 里的命令补装。按顺序跑下来示例会拿一张桌面截图加一句Reload cache做输入模型回话里会带出一条点击指令并在截图的落点位置画上一个绿圈——这就是你的第一次自动操作。跑通之后你大概率会想改它这就得先把两端的参数吃透。桌面端与移动端实操动作类型与参数对照️ 桌面端ComputerUse 的 14 种动作与参数ComputerUse的action一共有 14 个取值点击类left_click、right_click、middle_click、double_click、triple_click、移动与拖拽mouse_move、left_click_drag、滚轮scroll、hscroll、键盘key、type外加控制类wait、terminate、answer。参数含义很固定action必填执行哪个动作coordinate点击、拖拽、移动类动作依赖的 (x, y) 落点keys快捷键的按键序列如[ctrl, s]仅key用text要输入的文本仅type/answer用pixels滚动量正数向上、负数向下timewait的等待秒数。对它说点击刷新缓存按钮模型输出类似{ name: computer_use, arguments: { action: left_click, coordinate: [512, 137] } }示例用的截图实际是 3456x2160模型报出来的坐标却是 512 和 137——这就是 0–999 坐标系在工作。 移动端MobileUse 的 9 种动作与参数MobileUse的action有 9 个取值click、long_press、swipe、type、key、system_button、open、wait、terminate。和桌面端相比它没有鼠标按键之分多了手机系统键system_button的button参数取Back、Home、Menu、Enter四个值open的text参数写要打开的应用名。滑动swipe是唯一要两个坐标的动作coordinate是起点coordinate2是终点比如上滑一屏的指令是{ name: mobile_use, arguments: { action: swipe, coordinate: [499, 780], coordinate2: [499, 220] } }坐标范围同样是 0–999long_press和wait都共用time参数表示秒数。动作和参数都认识了接下来如果你要写自己的控制流程有三个最容易绊倒人的地方。自定义开发与避坑三个最可能踩的点坐标先换算再落点。模型输出的是 0–999 归一化值执行时要乘回真实分辨率x_实际 round(x / 999 * 宽)y 同理。如果截图进模型前经过 smart_resize 缩放先换算到模型看到的分辨率再映射到真机屏幕别跳步。给等待和重试留余地。应用启动、页面渲染都要时间动作后立刻截图很可能还是旧画面。工具描述里就提醒先wait再截一张图确认别急着发下一步点击没生效时把坐标往元素中心挪一点重试——描述原文的要求就是点元素中心别点边缘。先画点再执行。点错了先去哪找答案开发阶段把模型报的落点用 notebook 里的draw_point画在截图上一个半透明色圈加绿芯圈没压住按钮一眼就能看出来是坐标偏了还是理解偏了直接对着改。收尾从示例到你自己的场景这套能力的价值很具体表单批量填写、跨系统搬数据这类办公自动化不必逐个写选择器App 的 UI 自动化测试可以用自然语言描述打开某页、点某按钮来跑用例对行动不便的用户一块屏幕加一句话也能替代大量重复的手指操作。入口还是仓库里那几个 notebook桌面端 computer_use.ipynb、移动端 mobile_agent.ipynb感兴趣它在屏幕哪里还能顺手跑一下 spatial_understanding.ipynb。从 README.md 开始读起把仓库拉下来示例跑一遍就知道它适不适合你的场景。【免费下载链接】Qwen3-VLQwen3-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen3-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表