拓冰建站拓冰建站
首页 / 资讯中心 / 正文

CVAT 点云标注入门指南:如何用 3D 立方体搞定 LiDAR 自动驾驶数据集

CVAT 点云标注入门指南如何用 3D 立方体搞定 LiDAR 自动驾驶数据集【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvatCVAT 是开源的计算机视觉数据标注平台除了图片和视频它还能直接标注 LiDAR 点云上传 .pcd / .bin 文件用 3D 立方体框出车辆和行人并借助多视图投影把每个框的方位、尺寸调到毫米级可信。这篇指南讲清楚它解决什么问题、怎么最快跑起来、以及日常标注里真正好用的技巧。先搞清楚点云标注难在哪做自动驾驶感知团队都熟悉这个循环一辆车一秒钟扫出几十万个点标注员要在这些彩色沙粒里把每辆车、每个行人用一个带旋转角度的 3D 盒子圈出来。难点不在画框而在这三件事角度和尺寸靠手感。一个立方体在 3D 空间里有位置、旋转、长宽高共 7 个自由度纯靠旋转视角去凑效率低还容易前后帧不一致。单看透视视图判断不了高低。车在坡道上、行人被遮挡时俯视和侧视信息是透视视图给不了的。序列数据太冗长。同一辆车在 100 帧里都出现逐帧重画不现实必须靠跟踪插值。CVAT 的 3D 标注源码在 cvat-canvas3d/ 模块就是围绕这三点设计的四视图联动投影解决第一点上下文相机图像解决第二点Track 模式插值解决第三点。对比一些只支持 2D 框的方案它的关键差异是框是立在点云里的真 3D 立方体而不是拍在画面上的平面矩形。最快上手路径三条命令跑通 3D 标注前置要求只有 Docker、Docker Compose 和 Git。克隆仓库后一条命令起服务git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d服务起来后创建管理员账号docker exec -it cvat_server bash -ic python3 ~/manage.py createsuperuser然后浏览器打开http://localhost:8080登录。创建任务时的关键三步上传数据直接传.pcd或.bin文件推荐 zip 打包。CVAT 的媒体解析器会识别 3D 数据维度并把.bin原始二进制自动转成内部使用的.pcd格式转换逻辑见 cvat/apps/engine/media_extractors.py你不需要自己提前转格式。定义标签按场景建 car、pedestrian、traffic_cone 等类别可给每个类别配属性和颜色。建任务时注意多模态如果同一场景还有摄像头照片把它们放在名为related_images的文件夹里一起上传标注界面会自动多出一块上下文图像窗口帮你确认点云里这个物体到底长什么样——对一团点云是车还是卡车这类判断非常有用。官方对 3D 任务的完整操作说明在 site/content/en/docs/annotation/annotation-editor/3d-task-workspace.md 和 3D 物体标注文档。核心能力拆解四视图 立方体 跟踪一个透视窗口三个投影窗口CVAT 的 3D 画布是一大三小的布局中间的 Perspective 是主视图用来整体观察场景和放置立方体旁边的 Top / Side / Front 是跟随选中物体的投影——你选中哪个立方体三个小窗口就显示它从正上方、左侧、正前方的拍平视图。这套设计的妙处在于调旋转角时看 Front 和 Side 投影调高度看 Side调平面位置看 Top。鼠标按住投影里的框线拖动就能改对应维度比在 3D 空间里瞎拽快得多也是精度最有保障的操作方式。导航方面除了鼠标也支持键盘Shift方向键旋转相机AltJ/L 左右平移AltU/O 上下移动AltK/I 缩放。长时间标注后键盘流比纯鼠标省力不少。画框Shape 与 Track 两种模式标注一个立方体时CVAT 提供两种录入方式对应两种工作性质Shape逐帧形状当前帧框一次算一次适合物体只出现一两帧的偶发目标。Track跨帧跟踪给物体分配唯一 ID你只在关键帧上放置和微调中间的帧由插值自动推算位置。序列标注的主力就是这个模式。画一个标准立方体的流程是在对象面板选Draw new cuboid选标签和模式 → 光标会跟着一个半透明盒子在点云上双击落位 → 用投影窗口微调位置和旋转 → 拖四角控制点改长宽高 → 需要改朝向时选中中心控制点拖拽。两个容易忽略但很实用的细节立方体可以显示朝向箭头X 红 / Y 绿 / Z 蓝开关在外观设置里判断车头方向时一瞄即知侧边栏的属性面板支持手动输入长宽高精确数值遇到目测总是差一点的情况直接填数最干脆。复制、剪切这类小工具CVAT 把 2D 标注的快捷键习惯搬进了 3DCtrlC/CtrlV复制粘贴立方体粘贴时双击落位ShiftN剪切后同样双击放到新位置。同一个规格的锥桶重复出现时复制粘贴比重画快一个量级。真实场景怎么用一条感知数据从上车到入库场景一夜间路口车流量大。点云里车辆密集透视视图里盒子互相穿插。操作思路先用 Top 俯视图扫一遍确认目标数量和平面位置逐个选中后用 Front/Side 投影修旋转角和高度对连续 30 帧以上的车切 Track 模式首帧画准尾帧校一次中间帧基本不用碰。场景二坡道上的行人。行人高度信息在透视视图里很容易被遮挡误判这时切 Side 投影看地面接触点配合related_images里的相机照片确认是不是行人而不是路桩。场景三多人协作分工。按项目 → 任务 → 作业的层级把点云序列切成 Job 分给不同标注员组织与权限体系见 organizations 应用。质检侧可以开共识机制让两人标同一段再比对也能用 Issue / 评论把有争议的点云段落挂出来讨论流程文档在 docs 质量章节。场景四批量管理。标注员之外算法工程师可以用 Python SDKcvat-sdk/通过 REST API 批量建任务、拉取标注结果配合 SDK 自带的 PyTorch Dataset 类直接喂训练示例代码在 cvat-sdk/examples/。提效技巧与常见坑提效技巧先用 Track 关键帧后补 Shape整段序列 90% 的目标走插值剩下零星目标才逐帧画。同类物体复制粘贴锥桶、垃圾桶、共享单车这种尺寸固定的物体画一个当模板反复粘。尺寸输入框 朝向箭头一起开前者锁尺寸后者锁朝向省掉来回切换视图。键盘导航肌肉记忆熟练后 AltK/I 缩放替代滚轮手不离键盘。容易踩的坑浏览器官方主要测的是 Chromium 系Chrome、EdgeSafari 不支持Firefox 有兼容问题。3D 画布对 WebGL 依赖重浏览器不对时现象是画面卡顿或干脆不渲染。bin 转 pcd 的列数.bin是裸字节流转换时需要知道每点多少个通道。不同 LiDAR 的点数配置不同转换失败时先检查文件头信息和传感器配置是否匹配转换实现就在前面提到的 media_extractors.py 里。点数与性能单帧点云太密时浏览器渲染会掉帧可以先用工具降采样再上传标注精度对常规感知任务影响有限。坐标系一致性CVAT 内立方体的朝向遵循数据集自身坐标系导出后与相机/车辆坐标系的换算关系要在训练侧自行确认别假设和某个特定格式一致。上下文图像不是自动对位的related_images里的照片是按帧序号配对的上传时帧序必须和点云严格一致否则看到的参考照片是错的。进阶方向跑通基础流程后可以往三个方向扩展接入自己的模型做预标注CVAT 支持把检测/分割模型部署成 serverless 服务参考 serverless/ 目录下的部署脚本标注界面里点自动标注就能让模型先画一遍人工只改不对的这是大规模场景下压缩工时最直接的手段。自动化质检在人工互审之外通过 API 跑 Ground Truth / Honeypot 校验把质检从抽查看变成全量卡点。数据集导出与版本化标注完按项目导出为 COCO、KITTI 等通用格式或者用数据集清单机制管理多任务的批量导出交付流程不用手写脚本。写在最后CVAT 把 3D 点云标注里最磨人的部分——旋转角度、跨帧一致性、多模态参照——分别交给了投影窗口、Track 插值和上下文图像配合 Docker 一键部署和开放 SDK从有一堆 pcd 文件到产出可训练的感知数据集中间没有必须闭源或手搓脚本的环节。对刚接触 LiDAR 标注的团队建议先按本文的最小流程跑通一个十几帧的小数据集熟悉四视图操作习惯后再上长序列和团队协作流程。【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门