
CVAT 计算机视觉标注工具新手指南:3 步部署,5 个技巧让标注效率翻倍【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat假设你的团队要建一个街景目标检测数据集:上千张图片、要画框、要交 COCO 格式。手动一个个画?还是用工具?CVAT(Computer Vision Annotation Tool)就是为这类工作而生的开源计算机视觉标注工具——画布上支持框、多边形、掩码、骨架、3D 立方体,任务拆成项目-任务-Job 三层,导出一键切 20 多种格式。这篇指南带你从零把它跑起来,并按真实工作流走一遍。 从一个场景认识它:标注一个数据集到底需要什么结论先说:一个靠谱的标注平台要解决三件事——画得出来、分得下去、导得出去。CVAT 的标注工作区把三件事都摆在同一屏里:画得出来:左侧工具栏切换矩形框、多边形、折线、骨架、标签等图形;右侧面板管理对象列表、标签和属性,颜色、透明度随时调。分得下去:数据按 项目(Project)→ 任务(Task)→ 作业(Job) 组织,大视频可以切成多段分给不同标注员。导得出去:标注完成后按目标训练框架选择导出格式,不用自己写转换脚本。视频和点云也走同一套逻辑:逐帧画框、自动插值,点云则提供顶/侧/前三个视角联动,适合自动驾驶场景。 三分钟一键部署:Docker Compose 跑起本地 CVAT环境只需两个东西提前装好 Docker Engine 和 Git 即可。浏览器建议用 Chromium 系(Chrome、Edge),界面体验最好。拉代码、起服务、建账号git clone https://gitcode.com/GitHub_Trending/cvat/cvat cd cvat docker compose up -d服务起来后创建管理员账号:docker exec -it cvat_server bash -ic python3 ~/manage.py createsuperuser打开http://localhost:8080登录,就能看到 Projects、Tasks、Jobs 这些主入口。部署逻辑全部在 docker-compose.yml 里,后端、Worker、Kvrocks 缓存一目了然。 一条任务流水线:从上传数据到画下第一个框按这个顺序走,10 分钟内你就能产出第一批标注:建 Task 并上传数据。点 New Task,从 My computer 拖入图片、视频或点云压缩包,也可以接云存储(支持 S3、Azure Blob,配置参考 cvat-ui/src/components/ 中的 Cloud Storage 入口)。定义标签。给每个类别起名、配颜色;需要车型轿车/SUV这类附加信息时,给标签挂上属性。开始标注。选中图形工具画第一笔;视频模式下用 Propagate 让模型在相邻帧间插值,拖一下控制点即可补全整段轨迹。3D 数据则切到 Standard 3D 模式,在点云上直接画 cuboid,三个正交视图同步联动:每种图形(框、多边形、骨架、Tag)在 cvat-core/src/annotations-objects/ 里都有对应的 TypeScript 实现,想理解底层行为可以顺着源码读。 让模型先干粗活:自动标注 高频快捷键组合模型出初稿,人来精修仓库的 serverless/ 目录内置了 YOLO、PyTorch、OpenVINO、ONNX 等多种推理示例。把模型注册进 CVAT 的 Models 页面后,在任务里点 Automatic annotation,弹出配置框:选模型、把模型类别映射到你的标签、设阈值,还能用 Region of interest 限定只标某一块区域。点 Annotate 后,画布上直接铺满模型生成的框,你只需要修正漏标和错标,效率通常是纯手动的数倍:高频快捷键组合N:快速新建当前图形CtrlZ/CtrlS:撤销 / 保存进度←/→:上一帧 / 下一帧,配合空格键播放视频Tab/ShiftTab:在对象间循环切换选中Del:删除选中对象,精修阶段最常用 数据集格式对照:导出前先看这张表导出入口在 Job 或 Task 的 Dataset export 里,格式列表直接由 cvat/apps/dataset_manager/formats/ 下的转换器驱动。常用格式怎么选:你的目标推荐格式目标检测训练(COCO 生态)COCO传统检测/分割流水线Pascal VOCYOLO 系列模型YOLO(文本框标注)自动驾驶点云KITTI、Velodyne Point多目标跟踪MOT语义/实例分割Mask换平台继续标Datumaro、LabelMe、CVAT 自身格式导出前如果发现图形类型不对(比如把多边形转成掩码),用画布工具栏的 Shapes converter 批量转换即可: 团队标注与质检:多人协作不打架单人用 CVAT 是效率问题,多人用则是流程问题。CVAT 的答案是组织 审核流:角色分工:在 Organization 里设置管理员、标注员、审核者角色,Job 按人分配,进度实时可见。审核模式:审核者逐帧检查,发现错误直接在图形上标 wrong label 并附评论,标注员收到 Issues 后修复。质量统计:质检结果沉淀成报告,可对比不同标注员的分歧,必要时用 consensus 机制合并多份标注。相关计算逻辑(相似度比对、质量指标)都在 cvat/apps/quality_control/ 里,想看报告怎么生成的可以翻源码。 进阶路线:从会用到会用熟开发者接入:用 cvat-sdk/ 的 Python SDK 批量建任务、拉标注、下载数据集;REST API 文档见 cvat/schema.yml。插件扩展:前端插件机制已内置 SAM 分割示例,入口在 cvat-ui/plugins/。规模化部署:Kubernetes 部署清单在 helm-chart/,ClickHouse Grafana 的用量分析栈在 components/analytics/。下一步建议:先用 100 张图跑通上传 → 自动标注 → 导出 COCO这条最短链路,再逐步叠加团队成员和质检流程。遇到具体功能问题,翻一下 site/content/en/ 下的官方文档,每个模块都有对应章节。【免费下载链接】cvatComputer Vision Annotation Tool (CVAT) is a leading platform for building high-quality visual datasets for vision AI. It offers open-source, cloud, and enterprise products, as well as labeling services, for image, video, and 3D annotation with AI-assisted labeling, quality assurance, team collaboration, analytics, and developer APIs.项目地址: https://gitcode.com/GitHub_Trending/cvat/cvat创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考