ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

VisionAgent:用自然语言描述视觉任务,直接拿到可运行的代码

VisionAgent:用自然语言描述视觉任务,直接拿到可运行的代码 VisionAgent用自然语言描述视觉任务直接拿到可运行的代码【免费下载链接】vision-agentThis tool has been deprecated. Use Agentic Document Extraction instead.项目地址: https://gitcode.com/GitHub_Trending/vi/vision-agentVisionAgent 是 Landing AI 开源的视觉 AI 助手。你用一句话描述视觉任务再附一张图片或视频它就能完成视觉任务代码生成自动挑选视觉模型输出可直接运行的 Python 代码。生成的代码自带测试用例测试不过会自动迭代修改。整个流程走下来大概 5 分钟能拿到第一个能跑的结果。老办法 vs 新办法从找模型半天到一句 prompt自己搭一条数这张图里有几罐饮料的流水线得先找合适的检测模型、读文档、手写前后处理半天起步。同样的需求丢给 VisionAgent一句 prompt 加一张照片它输出的是一段可以直接运行的代码。跑起来就能用效果不对再对话式让它改。5 分钟拿到第一个结果一行命令安装 VisionAgent环境要求Python 3.9 及以上三把 API Key——VisionAgent 自己的 key、Anthropic key 和 Google key默认模型组合是 Claude 3.7 Sonnet Gemini Flash 2.0。一行命令安装pip install vision-agent把三把 key 设为环境变量如 VISION_AGENT_API_KEY最小示例from vision_agent.agent import VisionAgentCoderV2 agent VisionAgentCoderV2(verboseTrue) code agent(数一下图中的易拉罐, mediacans.jpg)返回的 code 是完整的脚本字符串写进文件就能直接执行。仓库里 examples/chat/ 目录下还有一个本地 Streamlit 网页界面可以边聊边看生成过程。适合它的三类场景工业质检自动生成产品缺陷检测代码问题换一种新品类就要重新找模型、重写检测流程。VisionAgent 产出的是能直接跑在你质检图片上的缺陷检测代码输出带缺陷区域标注的结果图。安防视频一句话生成目标跟踪代码问题多帧跟踪逻辑手写很繁琐。给一段监控视频说跟踪画面里的人它基于 owlv2_sam2_video_tracking 这类工具生成跟踪代码输出带轨迹标注的视频。零售客流输出带框的数量统计问题需要数画面里的人或商品。说一句统计图中人数它产出调用 countgd_object_detection 的计数代码输出是数量加带边框的可视化图。它是怎么工作的两个代理分工、模型可换、过程可见对话与代码分工VisionAgent 负责对话交互VisionAgentCoder 负责出代码按先出计划、再写代码、再跑测试的流程走。模型后端可插拔默认用 Anthropic Claude 加 Google Gemini换成 OpenAI 等其他供应商改 vision_agent/configs/config.py 并配好对应 key 即可。过程可查verboseTrue 时会打印计划步骤、中间代码和测试结果能看到它为什么选某个模型。动手前要知道的一件事每次调用都需要上述三把 API Key且输入必须是图像或视频没有媒体文件它不会生成代码。另有一处如实说明项目描述已标注该工具被弃用官方建议改用 Agentic Document Extraction如果你打算长期依赖它先用之前确认一下维护状态。key 配好后跑一条 pip install vision-agent再用四行脚本写下你的第一个视觉任务想先看看界面就从仓库的 examples/chat/ 起步。【免费下载链接】vision-agentThis tool has been deprecated. Use Agentic Document Extraction instead.项目地址: https://gitcode.com/GitHub_Trending/vi/vision-agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表