如何用CVAT做数据标注:从部署到导出的完整指南
如何用CVAT做数据标注从部署到导出的完整指南【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat做视觉模型的第一步往往卡在数据上手头有一批图片、视频或点云需要人工框出目标、标出关键点最后喂给训练框架。CVATComputer Vision Annotation Tool就是为这件事而生的开源标注平台——它把建任务、导入数据、画标注、质检、导出训练格式串成一条完整的流水线支持多人协作还能接入你自己的检测或分割模型来预生成标注。下面按一条真实业务流走一遍先把服务跑起来完成第一个标注任务再按你的数据类型选功能最后讲清楚质检标准和导出格式怎么选。在自己机器上跑起CVAT环境要求与最小化部署环境要求只有一行清单Docker Engine Docker Compose8GB 以上内存建议 16GB50GB 磁盘。默认部署不需要数据库和外部依赖PostgreSQL、Redis 都包含在 Compose 栈里。git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d docker exec -it cvat_server bash -ic python3 ~/manage.py createsuperuser第一条命令拉取代码详见仓库 README.md第二条启动全部容器第三条创建管理员账号。等 1~2 分钟后浏览器打开http://localhost:8080用刚创建的用户登录。如果你的部署环境需要绑定特定 IP 或域名在启动前设置CVAT_HOST环境变量即可路由会自动指向它。判断服务是否就绪首页能正常显示登录框即服务就绪。后台容器包括 server、UI、多个 worker 和调度器首次启动拉取镜像较慢属正常现象日志中 worker 全部显示 RUNNING 后再开始上传大文件。走通第一个标注任务创建任务并定义标签登录后进入 Tasks 页点击 Create a new task。创建页分三步Basic configuration填任务名选它所属的 Project可先建一个空项目用 Add label 定义标签如car、person。标签属性给标签加属性如occlusion的 0/25/50/100标注时每个对象都会带上这些字段导出后直接可用。Select files支持本机上传、挂载的共享目录、远程 URL 和云存储S3/Azure四种来源图片、视频、压缩包都接受。完成一轮标注并保存提交后 CVAT 按帧数把任务拆成若干 Job进入第一个 Job 开始标注左侧工具栏选择标注类型矩形框、多边形、折线、关键点、立方体等对应不同任务需求。右键画布可切换标签和颜色右侧面板可编辑对象的属性、score 和所属 track ID。逐帧标注完点 Save 提交进度自动记录在 Job 上下一张/上一张帧用快捷键 N/P 切换比点按钮快得多。一个任务的完整业务流就是建任务 → 定标签 → 导入数据 → 逐帧/逐图标注 → 保存提交 → 导出。走通这一遍后后续所有场景差异只是换一种数据类型和加一层质检。按场景选能力静态图像批量标注图像任务的技巧在复制上框完一个对象后复制该 shape 到相邻帧或相邻图像微调位置即可。CVAT 的 shape 支持复制到所有帧适合目标几乎不动的序列图。属性配置放在标签上而不是每个对象手填批量效率差异明显。视频任务关键帧 插值 跟踪视频是 CVAT 的主场三层机制叠加使用关键帧标注只在全局关键帧Global keyframe上画标注不用逐帧画。插值Interpolation在两个关键帧之间CVAT 按几何关系自动生成中间帧的标注位置画完首尾两帧后中间几十帧自动补全。跟踪器对连续运动的目标可在 shape 上用 MIL 等内置跟踪器把标注跑过一段帧序列减少手工拖拽。3D 点云任务自动驾驶、机器人场景用点云任务导入 PCD 文件或带多相机图像的点云包画布提供 Top/Side/Front 多视角联动标注对象是 3D 立方体cuboid可拖动调整长宽高和朝向。仓库内置的 KITTI、Velodyne 点云导出格式就是为这类场景准备的。用模型预生成标注CVAT 的自动标注走接入你自己的模型路线启动 serverless 组件Compose 栈附带的 serverless/ 目录提供了 SAM、YOLOv7、RetinaNet、HRNet 姿态估计等预置函数模板部署后在创建任务页选择模型提交时系统对全部帧跑一遍推理标注以待确认状态落画布人工只做修正。对大规模数据集这一步通常能省掉一半以上的手动框选。多人协作与分工团队场景用 Project Organization任务拆成 Job 后指派给不同标注员各自独立提交用 Comments 和 Issues 对具体 shape 或帧发起讨论、报 bug。对需要高一致性的数据开启 Consensus 模式同一 Job 生成多份副本由不同人标注最后按投票规则合并减少单人偏差。质检与数据导出怎么算合格项目级 Quality control 面板允许设置验收规则选定目标度量如 Accuracy和阈值如 70 分系统按帧比较不同标注员的结果低于阈值的 Job 会被标出。它支持勾选是否比较属性、是否要求空帧也必须标注还可以按 Job 过滤范围。配合前文的 Issues 机制返工范围可以精确到单个对象。导出什么格式、给谁用在 Job 或 Task 页选 Export annotationsCVAT 提供 20 种格式按下游框架选下游用途推荐格式通用检测训练PyTorch 生态COCO (JSON)YOLO 系列训练YOLO (TXT)、Ultralytics YOLO (TXT/YAML)经典检测基线Pascal VOC (XML)自动驾驶点云/标定KITTI、Velodyne 点云多目标跟踪MOT、MOTS语义/实例分割Mask 格式含类别掩码与实例掩码其他平台互通Datumaro、LabelMe格式决定字段结构比如 COCO 带完整图像尺寸与 category 映射YOLO 只有归一化坐标选格式前先确认训练脚本读什么比标注完再转换省事。导出是异步任务完成后页面提供下载链接。三个高频问题问打开 8080 端口一直转圈或 502容器还没起完。用docker compose ps确认 server、ui 都是 Running 再刷新远程访问时记得先设置CVAT_HOST否则路由只认 localhost。问自动标注页面没有模型可选社区版默认不部署任何模型。需要先加入 serverless 组件启动栈再用 nuctl 把某个模型函数部署上去模型才会出现在下拉框里。不需要自动标注的团队可以完全跳过这一步。问机器内存吃紧、上传视频卡住8GB 是底线。降低内存占用的直接手段不装 serverless 组件、减少同时上传的大视频、把视频任务帧率/分辨率调低。worker 数量可按需缩减。小结回看整条业务流要点是Docker Compose 一条命令起服务8080 端口 superuser 登录任务 标签定义 数据源 拆分 Job走通一次即可复用视频用关键帧 插值 跟踪3D 用多视角 cuboid规模大再接入模型预标注验收靠 Quality control 的指标阈值 Consensus 合并导出格式对齐下游框架数据标注没有捷径但工具链选对之后剩下的工作量是线性可预期的。CVAT 把这条链路里的每一步都落在了本地环境里数据不出内网格式直接对接训练侧——这正是自托管开源版相对托管服务最实际的价值。【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考