2026年6月6日星期六

NVIDIA LocateAnything视觉定位模型 一句话定位物体 比Grounding DINO快100倍

NVIDIA推出全新视觉定位模型LocateAnything,支持自然语言在图像中精准定位任意目标。核心创新并行框解码技术,推理速度比Grounding DINO快100倍,单个H100达12.7框/秒。适用于文档理解、GUI接地、密集目标检测等场景。已上线Hugging Face免费在线Demo,适合AI研究者、开发者及具身机器人领域试用。

Tags:

点击下方名片关注AIGC Studio公众号获取最新AI前沿应用/AIGC实践教程
扫描下方二维码,加入AIGC Studio知识星球可以获得最新AI前沿应用/AIGC实践教程/大厂面试经验/算法刷题IT各学科入门到精通学习资料学习/科研/工作/副业,强烈推荐!
图片

大家好,今天给大家介绍由NVIDIA提出的全新的视觉定位模型 LocateAnything,支持通过自然语言在图像中精准定位任意目标,速度比经典的Grounding DINO快了整整 100倍,真正做到了"又快又准"。目前NVIDIA已在Hugging Face上线了在线Demo,人人可试,效果炸裂!

  • ⚡并行框解码(PBD):原子化的单步解码完整边界框/点。
  • 🔁混合推理:默认采用快速模式 (MTP),并无缝回退到 NTP 以确保稳定性。
  • 📚 LocateAnything-Data:1.38亿次语言查询,7.85亿个框,涵盖检测、GUI 接地、指代理解、OCR、布局和指向。
  • 🏆最先进的技术:单个 H100 即可达到 12.7 BPS(≈ 10 倍 Qwen3-VL,2.5 倍 Rex-Omni),在 LVIS、M6Doc、ScreenSpot-Pro 等应用上具有 SOTA 精度。
图片

密集对象检测:LocateAnything 在统一的 VLM 下执行各种定位任务——文档理解、GUI 接地、密集对象检测和 OCR。

unsetunset相关链接unsetunset

  • 论文:https://arxiv.org/pdf/2605.27365
  • 代码:https://github.com/NVlabs/Eagle/tree/main/Embodied
  • 模型:https://huggingface.co/nvidia/LocateAnything-3B
  • 试用:https://huggingface.co/spaces/nvidia/LocateAnything
图片

unsetunset论文介绍unsetunset

本篇由 NVIDIA 研究院联合多所海内外高校联合发表,核心创新Parallel Box Decoding (PBD 并行框解码),跳出传统逐坐标串行生成的固有范式。现有 VLM 用文本 / 量化序列化坐标,割裂边框内在几何关系,MTP 通用分块又随机切分 token 易产生无效关联;PBD 直接以完整边框为最小预测单元,单步输出四坐标。团队同步搭建百万级多领域数据集,设计快慢混合三套推理策略,在 COCO、LVIS、GUI、文档等数十项基准完成全维度测评,验证并行解码兼顾推理吞吐与定位精准,为具身机器人、办公 AI 等落地提供轻量化高性能方案。

unsetunset方法概述unsetunset

基础架构

图片

模型依托Moon-ViT 原生分辨率视觉编码器 + Qwen2.5 语言底座,MLP 跨模态映射层衔接视觉与文本特征,摒弃固定尺寸压缩,完整留存图像空间细节。输出摒弃零散 token 序列,自定义语义块、框块、负样本块、结束块四类结构化单元,单个块打包整套边框坐标,统一输出格式。

PBD 并行解码核心设计

图片

采用NTP 自回归 + MTP 并行双联合训练:一套分支保留传统逐 token 训练保障模型语言理解,另一分支按整框分块并行训练;块内 token 双向注意力、块间因果注意力,既保留上下文时序约束,又能同框坐标同步预测,从结构匹配边框天然耦合特性。

三档自适应推理模式

图片
  • Fast 快速模式:全并行解码,最高 16.9BPS,适配端侧机器人、实时 AI;
  • Slow 精准模式:沿用经典自回归,追求高 IoU 标注,用于数据集精标;
  • Hybrid 混合(默认):常态并行,检测坐标置信偏低、格式错乱时局部切回 NTP 重译,平衡速度精度(12.7BPS,文章实测主推方案)。

LocateAnything-Data 数据集

图片

全量 12M 独图、138M 查询、785M 标注框,六大任务:通用检测 66.9%、GUI 定位 16.5%、指代 7.3%、OCR3.6%、版面 3.5%、点标注 2.2%;融合开源数据 + Qwen/Molmo/SAM 自动化标注引擎,补充海量负样本规避模型幻觉。

unsetunset实验结果unsetunset

图片每一行展示了不同目标对象数量和不同框尺寸的测试用例。不同的颜色代表不同的查询类别,包括属性查询、部件查询、推理查询和空间查询。该模型能够始终如一地定位不同场景、任意图像分辨率、自由文本查询以及任意数量的目标,展现出强大的鲁棒性。

图片
  • LocateAnything-3B 在 H1 上单卡 Hybrid 模式达12.7 框 / 秒,相较 Qwen3-VL (1.1BPS) 提速超 10 倍、Rex-Omni (5.0BPS) 提速 2.5 倍。
图片
  • 通用检测:LVIS 高 IoU (0.95) F1=31.1,大幅领先 Rex-Omni 的 20.7;COCO 平均 F1 54.7,小参数量对标大模型不输;
图片
  • 密集目标:Dense200、VisDrone 密集小目标基准均值 39.9F1,堆叠物体边界区分显著优于主流 VLMs;
图片
  • 专项场景:GUI ScreenSpot-Pro 平均 60.3F1,DocLayNet 文档 76.8、M6Doc70.1,刷新文档解析 SOTA;
图片
  • 消融验证:同 Qwen3-VL 底座替换 PBD 后,COCO F1 从 50.8 升至 52.0,吞吐由 2.8→9.4,验证解码方案通用性。

unsetunset快速入门unsetunset

import torch
from PIL import Image
from locateanything_worker import LocateAnythingWorker

worker = LocateAnythingWorker("nvidia/LocateAnything-3B")
img = Image.open("example.jpg").convert("RGB")

# Object Detection
print(worker.detect(img, ["person""car""bicycle"])["answer"])

# Phrase Grounding
print(worker.ground_multi(img, "people wearing red shirts")["answer"])

# Scene Text Detection
print(worker.detect_text(img)["answer"])

# GUI Grounding (point)
print(worker.ground_gui(img, "the search button", output_type="point")["answer"])

# Pointing
print(worker.point(img, "the traffic light")["answer"])

unsetunset结论unsetunset

LocateAnything 通过 PBD 并行解码解决 VLM 定位 “串行慢、几何乱” 的老问题,搭配自建多领域海量数据,实现速度、精度双向突破。三档推理方案覆盖从终端嵌入式机器人到离线数据标注全产业链需求,小参 3B 即可对标大尺寸专用检测模型。当前模型仅以监督微调训练,后续可接入强化学习进一步降低异常回退概率,未来在智能体操控、自动化 UI 测试、PDF 智能解析、工业视觉检测等领域具备广阔落地空间。

感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

图片

没有评论:

发表评论

免费AI视频生成工具seedance2。0mini无水印全能参考附微表情提示词

介绍一款可免费生成一次的视频AI工具,支持seedance2.0mini、wan2.7、imga2等模型,注册简单,生成视频无水印且支持全能参考。文中提供人物微表情提示词及真人Skill组合用法,适合AI创作者快速测试角色表情效果。 Tags: AI视频生成 免费试用 ...