NVIDIA LocateAnything 针对多模态人工智能中最实用的问题之一:将语言定位到精确的视觉位置。模型可能理解用户在询问按钮、对象、文本块或视觉区域,但实际应用需要机器可操作的坐标、框或点。
传统的视觉语言定位模型通常逐令牌生成边界框坐标。这导致框的几何形状与文本生成的顺序性不匹配。LocateAnything 通过将框或点视为完整单元改变了解码策略,允许更多并行处理和更好的几何一致性。
这一结果对构建视觉代理、文档人工智能、用户界面自动化、机器人和检测系统的开发者非常重要。如果模型能够准确快速地定位目标,它将成为需要点击、检查、注释、计数、导航或在物理和数字世界中行动的代理的感知层。


