
Android World 64.2 分背后UI-TARS 如何用 3 行代码跑通移动端自动化测试【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS上周回归测试又挂了一次 UI 改版让 30 条 XPath 全部失效重新定位元素耗了整个下午。UI-TARS 用截图代替元素树做移动端自动化测试把这类工作流压缩到几行代码就能跑起来。手写 XPath 为什么扛不住 UI 改版版本上线前跑回归是最典型的场景。Appium 脚本绑死的是控件 ID 和 XPath 路径产品端挪一个按钮、改一次文案整套脚本就得跟着修。我们之前维护过 200 多条用例每次发版前光是定位修复就要半天。新机型适配时问题更明显同一套操作在不同分辨率和系统皮肤下控件属性经常对不上写死的坐标直接失灵。自定义控件和 Canvas 渲染的界面更基本碰不到。从截图到脚本视觉驱动的三步链路看整张截图直接喂给视觉语言模型不依赖控件树。界面长什么样模型就看到什么样自定义组件和 Canvas 元素也不例外。想动作之前模型先输出一段 Thought多步推理再决定下一步做什么而不是看到就点。这一步由强化学习训练支撑。做输出被解析为 click、type、scroll 等标准动作再转成可执行的 pyautogui 脚本。核心解析逻辑在 action_parser.py。3 行代码跑通 UI 回归部署模型后拿到一条模型回复解析和代码生成就两步from ui_tars.action_parser import parse_action_to_structure_output, parsing_response_to_pyautogui_code resp Thought: Click the search box\nAction: click(start_box(100,200)) parsed parse_action_to_structure_output(resp, factor1000, origin_resized_height1080, origin_resized_width1920, model_typeqwen25vl) code parsing_response_to_pyautogui_code(responsesparsed, image_height1080, image_width1920) print(code)运行后你会看到一段带import pyautogui的可执行脚本坐标已按原图分辨率换算完毕粘贴到测试环境直接跑。Android World 64.2 分是怎么来的基准UI-TARS-1.5对比Android World移动端64.2此前 SOTA 59.5OSWorld桌面100 步42.5OpenAI CUA 36.4ScreenSpotPro元素定位61.6Claude 3.7 27.7三组数据分别来自 Android World、OSWorld 和 ScreenSpotPro 官方评测移动端和桌面端都有覆盖看对、点对这件事上模型已经比较稳。目前能做什么、不能做什么适合中低复杂度 GUI 回归、跨机型冒烟测试、无控件树可查的 Canvas / 游戏界面操作。不适合高频大批量并行任务——推理耗时和算力开销是真实成本涉及验证码等安全场景也不建议直接跑。7B 版本注意开源的 UI-TARS-1.5-7B 侧重通用桌面操作游戏场景表现弱于完整 1.5 版本选型时留意。如果你的回归测试还在手写 XPath值得花 10 分钟把 UI-TARS 跑一遍看看截图驱动能不能把定位维护的成本砍下来。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考