十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

一句话找到图中的“猫“:GroundingDINO 零样本检测实战指南

一句话找到图中的“猫“:GroundingDINO 零样本检测实战指南 一句话找到图中的猫GroundingDINO 零样本检测实战指南【免费下载链接】GroundingDINO[ECCV 2024] Official implementation of the paper Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection项目地址: https://gitcode.com/GitHub_Trending/gr/GroundingDINO每来一个新类别就要重新标注、重新训练、重新部署——这是传统目标检测项目最常见的卡点。GroundingDINO 是面向开放世界的零样本目标检测模型给它一张图加一句自然语言它就把句子里提到的对象框出来不预定义类别也不需要标注数据。它是干什么的用图 一句话做开放集检测把它理解成一名听案情的人你不给他嫌疑人名单类别白名单只用大白话描述要找的目标特征他再去对照监控画面标出符合条件的面孔。输入是一对(image, text)输出是一批候选检测框每个框都带有与句中每个词的相似度再由两个阈值筛出最终结果。它不做的也写清楚不做像素级分割官方仓库只放出推理代码、没有训练代码所以把它当检测器用而不是当训练工具包。最快跑通clone、装依赖、跑通首次推理 三步拿到第一张带框的图。克隆并安装。两条命令git clone https://gitcode.com/GitHub_Trending/gr/GroundingDINO cd GroundingDINO pip install -e .预期安装顺利完成。若没设置CUDA_HOME会自动退回 CPU 模式能跑只是慢。准备权重。从项目 Releases 页下载groundingdino_swint_ogc.pthSwin-T 版放到项目根目录的weights/文件夹里。另有更大的 Swin-B 版本首次体验建议先用小的。跑第一次推理。仓库自带示例图直接用python demo/inference_on_a_image.py -c groundingdino/config/GroundingDINO_SwinT_OGC.py -p weights/groundingdino_swint_ogc.pth -i .asset/cat_dog.jpeg -o logs/demo -t cat . dog .预期logs/demo/下生成pred.jpg图中猫和狗各有一个框旁边标着类别名。核心能力从类别词到短语级定位类别词批量检测最高频的用法是多个类别名用.分隔一起喂进去。比如内容审核同学给商品图库做初筛提示词写敏感物品类名命中框的图才转人工复核人工量直接砍掉一个量级。短语级精确定位。给一句长描述时用--token_spans指定短语的 token 位置模型只输出该短语对应的框。做标注数据清洗的人最懂它的价值一堆混合图里只要某一类物体不想让句子里的其他词干扰结果。Gradio 网页界面。运行demo/gradio_app.py就能打开一个上传图、输文字、实时看框的页面给不写代码的同事做演示时最快不用解释任何命令行参数。真实工作流自动标注与图像编辑两条链路场景一自动标注流水线。上游是一批未标注的原始图片GroundingDINO 负责批量检测下游把结果写成 COCO 格式做数据集管理或直接拿去训该领域的专用检测器。过去要标几天的图现在一个下午出初稿人工只回看低置信度的框。仓库自带辅助脚本 demo/create_coco_dataset.py 用于构造 COCO 格式数据。场景二精准图像编辑。和 Stable Diffusion 配合先用检测提示词锁定要改的区域比如图中black cat再把框交给扩散模型重绘内容其余部分原样保留。官方 notebook 里有完整示例代码。新手高频疑问_C 报错、阈值怎么调、没有 GPU 怎么办问启动时弹出NameError: name _C is not defined答CUDA 扩展没编译成功。先用echo $CUDA_HOME确认路径已设置且版本与运行时一致然后删掉克隆目录完整重装一遍。问box_threshold 和 text_threshold 怎么调答默认 0.3 和 0.25。误检多就调高漏检多就调低。注意 text_threshold 只在类别词模式生效一旦指定 token_spans代码会自动把它置为 None不用你再传。问没有 GPU 能跑吗答能。demo 命令后加--cpu-only即可运行但速度慢适合少量图或验证流程批量处理还是用 GPU。问文本提示词怎么写效果好答用简短的名词短语多类别用.分隔模型会自动补句末句号。句子写得越具体配合 token_spans 的细粒度控制就越有用。一句话总结与下一步GroundingDINO 把标注、训练、部署压缩成写一句话让你先验证效果、再决定要不要投入专用模型。上手之后值得深入两个方向读原论文了解开放集检测的训练思路或把它和 SAM 结合Grounded-SAM 的做法从框出来升级到抠出来。完整参数说明见 demo/inference_on_a_image.py。【免费下载链接】GroundingDINO[ECCV 2024] Official implementation of the paper Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection项目地址: https://gitcode.com/GitHub_Trending/gr/GroundingDINO创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表