NVIDIA LocateAnything는 다중 모달 AI에서 가장 실용적인 문제 중 하나인 언어를 정확한 시각적 위치에 연결하는 작업을 목표로 합니다. 모델은 사용자가 버튼, 객체, 텍스트 블록 또는 시각 영역에 대해 묻고 있음을 이해할 수 있지만, 실제 응용 프로그램에서는 기계가 작동할 수 있는 좌표, 박스 또는 포인트가 필요합니다.
전통적인 비전-언어 그라운딩 모델은 종종 경계 상자 좌표를 토큰별로 생성합니다. 이는 상자의 기하학과 텍스트 생성의 순차적 특성 사이에 불일치를 만듭니다. LocateAnything는 박스나 포인트를 완전한 단위로 처리하여 디코딩 전략을 변경함으로써 더 많은 병렬성과 더 나은 기하학적 일관성을 가능하게 합니다.
이 결과는 시각 에이전트, 문서 AI, UI 자동화, 로보틱스 및 검사 시스템을 구축하는 개발자에게 중요합니다. 모델이 목표를 정확하고 빠르게 위치시킬 수 있다면, 클릭, 검사, 주석, 계산, 탐색 또는 물리적 및 디지털 세계에서 작동해야 하는 에이전트의 인지 계층으로서 더 유용해집니다.


