LocateAnything：基于并行框解码的快速高质量视觉语言定位

Shihao Wang, Shilong Liu, Yuanguo Kuang, Xinyu Wei, Yangzhou Liu, Zhiqi Li, Yunze Man, Guo Chen, Andrew Tao, Guilin Liu, Jan Kautz, Lei Zhang, Zhiding Yu

发表年份: 2026
引用次数: 0
访问权限: 开放获取

摘要

本文提出LocateAnything框架，通过并行框解码（PBD）将边界框等几何元素作为原子单元一步解码，保持了几何一致性并实现了并行化，显著提升了解码吞吐量和定位精度。同时构建了包含1.38亿训练样本的大规模数据集，在多个基准上实现了速度与精度的前沿性能。

关键词

parallel box decodingvision-language groundingvisual detectiongenerative frameworklarge-scale dataset

LocateAnything：基于并行框解码的快速高质量视觉语言定位

摘要

关键词

相关论文

Artificial intelligence: a modern approach

Are we ready for autonomous driving? The KITTI vision benchmark suite

TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems

Vision meets robotics: The KITTI dataset