ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

VIA 标注工具:一个不到 300KB 的单文件图像、音频与视频注释软件

VIA 标注工具:一个不到 300KB 的单文件图像、音频与视频注释软件 VIA 标注工具一个不到 300KB 的单文件图像、音频与视频注释软件【免费下载链接】via(MIRROR) see https://gitlab.com/vgg/via/项目地址: https://gitcode.com/gh_mirrors/via/viaVIAVGG Image Annotator是一款运行在浏览器里的图像、音频与视频注释工具无需安装、离线可用整个软件打包成单个小于 300KB 的 HTML 文件。项目背景它是谁在维护解决什么问题VIA 由牛津大学视觉几何组VGG开发并维护代码遵循 BSD-2 许可证学术和商业场景都能用。它解决的是一个很具体的问题训练视觉或语音模型前需要先人工标出哪里是杯子哪段是人说的话而传统标注软件往往依赖重、要装环境、还常要联网。VIA 把这件事压缩进一个网页让标注像打开一个文档一样简单。项目从 2016 年 8 月启动2017 年 4 月发布首个公开版本到 2019 年累计使用已超 100 万次。整个仓库按大版本分成via-1.x.y/、via-2.x.y/、via-3.x.y/三个目录可按需求选择对应版本。技术实现只用 HTML、CSS 和 JavaScriptVIA 不依赖任何外部框架或库所有能力都建立在这几样东西上JavaScript交互、标注逻辑与事件处理的核心HTML界面骨架也是离线应用的入口CSS界面样式Python 打包脚本scripts/pack_via.py把分散的模块合并成单个 HTML 文件VIA 3 的完整应用是一个约 275KB 的 HTML 文件由近 8000 行 HTML、CSS 和 JavaScript 组成。这张模块依赖图展示了各部分之间的关系核心能力一次标注图像、音频与视频VIA 3 同时覆盖三类内容主要功能如下图像框选与点选对单张图绘制矩形、圆形、椭圆、多边形、折线和点。视频时间轴标注在视频上切出时间段再给画面里的对象框出空间区域。音频分段标注把一段对话切成谁在什么时候说话的时间片段。属性与标签给每个区域和文件附加文本、下拉、单选、复选等类型的属性。格式导出结果可导出为 CSV也能转成 COCO 等常见格式。下面两张图分别展示了图像标注和人脸轨迹标注的实际界面轻量与上手打开一个 HTML 文件就开始标注这是 VIA 最省心的地方。它不需要装依赖、不需要起服务、不需要联网浏览器打开就能跑还能离线用。上手有两种方式直接打开拿到打包好的单个 HTML 文件如图像、视频、音频标注器用现代浏览器打开即可本地文件和远程文件都能标注。从源码获取把仓库拉到本地git clone https://gitcode.com/gh_mirrors/via/via运行scripts/pack_via.py打包出对应标注器再在浏览器中打开。每个标注器都自带预载了示例数据的 demo打开就能体验常见功能很适合第一次接触标注的人。适用场景谁会用得上它机器学习研究者快速给数据集打框、打点准备训练数据。课程与教学给学生一个零门槛的标注练习环境。内容整理与审核对图片库、录音、视频做批量人工整理。个人项目想把视频里的动作、物品标记出来又不想装重型软件。人脸与轨迹标注给视频里的人脸做跨帧标注。近期更新从图像扩展到音、视频最近几个版本的重心是把工具从只会标图扩展成音、视频都能标并持续打磨细节VIA 3新增音频与视频标注器支持时间轴切分与空间区域标注并引入字幕标注器。放大查看 图像标注器支持放大镜方便看清细节后再标。协作标注通过分享功能让多人协作合并时使用三路合并算法。格式互通视频帧级标注可导出为 COCO 格式方便接入主流框架。快捷键提速用 n/p 切换文件、方向键切换帧标注手速更快。界面布局也在持续调整如下方的界面示意图目标是让标注动作更贴近键盘操作、更少打断思路。【免费下载链接】via(MIRROR) see https://gitlab.com/vgg/via/项目地址: https://gitcode.com/gh_mirrors/via/via创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表