ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

让 AI 接管你的鼠标和键盘:GUI 智能体 Agent-S 如何突破 72.6% 人类分数线的完整指南

让 AI 接管你的鼠标和键盘:GUI 智能体 Agent-S 如何突破 72.6% 人类分数线的完整指南 让 AI 接管你的鼠标和键盘GUI 智能体 Agent-S 如何突破 72.6% 人类分数线的完整指南【免费下载链接】Automatic_ticket_purchase大麦网抢票脚本项目地址: https://gitcode.com/GitHub_Trending/au/Automatic_ticket_purchase让 Agent-S 替你在 Excel 里建一张数据透视表。这个开源 GUI 智能体在 OSWorld 基准上拿到 72.6% 的成功率是首个超过人类均分的成绩。十分钟跑起来 ⚡系统支持很宽Linux、macOS、Windows 都能跑。启动前先把模型 API 密钥配成环境变量比如 OPENAI_API_KEY用本地模型的话再加一个 HF_TOKEN。安装就一行pip install gui-agents启动agent_s \ --provider openai \ --model gpt-5-2025-08-07 \ --ground_provider huggingface \ --ground_url http://localhost:8080 \ --ground_model ui-tars-1.5-7b \ --grounding_width 1920 \ --grounding_height 1080 \ --enable_local_env启动后在终端输入一个任务GUI 智能体就开始自己动鼠标、敲键盘。加了 --enable_local_env 之后它还能执行 Python 脚本、跑 bash 命令、读写文件不只是盯着屏幕点点点而是真正接管计算机操作。它为什么能稳定做完长任务长任务最容易死在一步走偏、满盘皆乱上。Agent-S 用两个机制兜住这一点。第一个是分层记忆。系统把记忆分成两层叙事记忆存抽象思路比如在电子表格里求和用 SUM 函数情景记忆存具体操作序列比如先选中 A1:C10 区域再输入公式。相当于一本笔记本左页记思路右页记实际操作日志。遇到新任务既能借通用策略也能翻之前的操作记录。实现在过程记忆模块。第二个是 BBoN 多轨迹策略。思路像做同一道题先试三遍再挑最优解为同一任务生成多条执行轨迹自动描述每一步的屏幕变化再比较评估选出最优路径。代码在 BBoN 实现目录。以在 Excel 里建数据透视表为例第一条轨迹可能点错菜单第二条 8 步做完第三条卡在弹窗里。BBoN 会挑出第二条。长任务稳不稳就稳在这一步。基准成绩一览 OSWorld 基准上的对比系统成功率与人类差距Agent S3BBoN72.6%0.6%Agent S3标准66.0%-6.0%GTA1 w/ GPT-563.4%-8.6%Claude 3.7 Sonnet62.9%-9.1%同一套系统开上 BBoN成功率直接高 6.6 个百分点。跨平台泛化也不虚WindowsAgentArena 准确率从 50.2% 升到 56.6%AndroidWorld 从 68.1% 升到 71.6%Linux 上表现稳定。挑 2-3 个场景先用起来办公文档处理。输入是一堆乱文件。它批量重命名、按规则归到对应文件夹长文档也能提取内容、生成摘要、转换格式。产出是整理好的文件和一份能直接读的摘要。部署运维。输入一句把应用部署到 /opt/app。它自己克隆仓库、装依赖、起服务。输入一句话产出是一个能访问的服务。客服。自动回复常见咨询从多个系统里拉客户信息生成个性化响应顺手把服务日志记下来。输入是客户问题产出是回复和一条完整的服务记录。接下来怎么走按预算选模型追求最高成功率主模型用 GPT-5-2025-08-07。想控成本就用开源的 UI-TARS-1.5-7B 做定位模型本地通过 HuggingFace 服务跑屏幕分辨率建议配 1920×1080。更远一点的方向是让多个智能体实例分工协作跨节点做负载均衡和故障转移。给它一个任务看它干活。【免费下载链接】Automatic_ticket_purchase大麦网抢票脚本项目地址: https://gitcode.com/GitHub_Trending/au/Automatic_ticket_purchase创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表