ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

UI-TARS Desktop 如何用一句自然语言操作电脑与浏览器:完整上手指南

UI-TARS Desktop 如何用一句自然语言操作电脑与浏览器:完整上手指南 UI-TARS Desktop 如何用一句自然语言操作电脑与浏览器完整上手指南【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktopUI-TARS Desktop 是一个开源的多模态 AI 智能体桌面应用它用视觉语言模型看懂你的屏幕再把一句自然语言指令翻译成点击、输入、滚动这些具体动作替你操作电脑和浏览器。项目基于 UI-TARS 视觉智能体模型构建内置本地计算机与本地浏览器两种操作模式Windows 和 macOS 都能装任务结束后还能导出图文报告。对每天被重复操作填满的人来说它省下来的不只是时间还有耐心。上手体验装好、配好模型、发出第一条指令整个流程大约十分钟内可以走完。三步安装 UI-TARS Desktop 桌面应用先去项目发布页下载对应平台的安装包整个过程只有两步Windows运行安装程序后系统可能弹出 SmartScreen 提示点仍要运行即可正常安装。macOS把 UI TARS 应用图标拖进 Applications 文件夹就算装完了。最快完成 VLM 模型配置应用打开后点左下角的 Settings进入 VLM Settings。这里有四个必填项VLM Provider从下拉框选模型提供方支持 Hugging Face for UI-TARS-1.5、VolcEngine Ark for Doubao-1.5-UI-TARS 等选项。VLM Base URL模型的 OpenAI 兼容接口地址。VLM API Key对应的密钥。VLM Model Name模型名称例如 doubao-1.5-ui-tars-250328。两个容易翻车的细节Provider 一定要和实际部署的模型对上动作解析才正确如果走 Hugging Face 部署Base URL 结尾要带/v1/。填完后点Check Model Availability通了再往下走。发出第一条指令回到首页在两张卡片上选择运行模式Computer Operator → Use Local Computer控制你本机的鼠标键盘Browser Operator → Use Local Browser只做网页自动化需要本机已装 Chrome、Edge 或 Firefox。选中后进入对话页在输入框直接说人话比如帮我打开记事本输入今天的日期回车执行。执行过程中左侧会逐步展示模型的思考和每一步动作右侧同步刷出屏幕截图。任务跑完可以点右上角的 Export as HTML 生成图文报告如果你配置了报告存储地址导出后链接会直接进剪贴板方便转发。能力边界先说清楚它的能力圈再谈用不香的问题就小很多。它擅长的事用自然语言完成桌面操作和浏览器操作支持 Windows / macOS 与浏览器三种环境每一步都有截图与状态展示执行到哪一步看得见报告机制导出 HTML 报告、可选上传分享浏览器模式里可以随时接管鼠标把方向盘抢回自己手里。它暂时做不了的事目前只支持单显示器环境多屏配置下部分任务会失败官方文档说明免费的 Remote Operator 服务已于 2025 年 8 月 20 日停用远程操作需要自行部署它不是万能的——复杂任务会受最大循环次数限制默认 100 步可在设置里调 25 到 200到了上限任务会停下速度取决于模型推理速度长任务要等急事别指望它秒回。前置条件清单macOS 需要授予两个权限辅助功能控制鼠标键盘和屏幕录制让它看见屏幕。系统设置 → 隐私与安全性中打开对应开关即可。Windows 首次启动可能遇到 SmartScreen 拦截点仍要运行。浏览器模式要求本机装有 Chrome、Edge 或 Firefox。原理揭秘抛开术语它干活的方式就是一个不断重复的循环和你的操作习惯其实很像 截图先拍一张当前屏幕的快照送审把你的指令、可执行的动作清单和最近几张截图一起发给视觉语言模型出动作模型返回下一步该做什么比如click(start_box(27,496))执行操作器真的去点那个坐标然后回到第 1 步直到模型判断任务完成或达到循环上限。每一轮它都只根据眼前看到的东西做决定所以页面变化了它也能跟着调整——这也是它比写死的宏脚本灵活的原因。任务结束后还有一条分享链路点 Share 后应用先判断你有没有配置报告存储服务端配置了就上传 HTML 报告并生成可访问链接没配置就直接下载到本地如果还接了 UTIO 数据收集服务事件会一并上报方便团队做使用分析。实战场景电商运营跨平台查价入库使用前运营小林要核对 6 个平台的同款商品价格手动打开每个网站、搜商品、记表格一轮下来 40 分钟还容易抄错数字。使用后给 UI-TARS 一句依次打开这 6 个平台搜索 XX 商品把当前最低价记录到这张表它逐个页面操作、把结果填进表格小林转去写竞品分析回来只需核对。软件测试版本回归冒烟使用前QA 小周每发一个版本都要手工过一遍登录、下单、改密码这 15 项基本流程20 分钟起步重复到麻木。使用后一句按这份清单逐项执行并截图机器点完 15 项小周只看截图和报告人工复核压到 5 分钟。数据分析师网页报价单搬运使用前分析师把 30 页的网页报价单一条条抄进 Excel加格式一小时没了。使用后把逐页打开这些链接把报价表复制进 Excel 对应位置交给它跑人只在最后抽查几行数字全程两分钟。避坑指南这些问题基本都踩过对应解法如下模型检测不通过九成是 Provider 没选对或 Base URL 少了/v1/。保存前再跑一次 Check Model Availability把配置问题拦在执行之前。任务老点错地方给它更具体的指令。比如点击右上角那个蓝色按钮按钮文字是提交比单说点提交靠谱得多。多显示器下行为怪怪的切回单屏再跑。这是官方明确写明的限制。浏览器模式没反应先确认 Chrome、Edge、Firefox 至少装了一个装好后重启应用。页面没加载完就动手了到 Chat Settings 里把 Loop Wait Time 调大一些给每步操作留出页面渲染的时间。扩展与社区想自己动手改仓库留了很多抓手做二次开发首选 ui-tars/sdk跨平台的 GUI 自动化智能体框架Node.js 和浏览器环境都能跑官方还提供 npx ui-tars/cli start 命令行体验方式。操作器可以换、可以写packages/ui-tars/operators/ 下已有本地桌面、浏览器、ADB 安卓和浏览器沙箱等现成实现自己实现一个只需补上screenshot()和execute()两个方法。智能体核心逻辑在 multimodal/agent-tars/MCP 相关基础设施在 packages/agent-infra/想接自己的工具链可以从这里入手。照着 examples/ 抄作业最快里面连预设配置文件examples/presets/default.yaml都给你备好了。社区参与提 Issue、提交 PR或者往预设仓库贡献一份你调好的配置都是低门槛的贡献方式。写在最后从安装到跑通第一条指令整个过程比想象中平滑剩下的事就是慢慢把更多杂活交给它。现在就可以打开应用先配好模型发一句打开浏览器搜索今天的天气看看它截图、思考、动手的完整过程。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表