NVIDIA LocateAnythingはマルチモーダルAIにおける最も実用的な問題の一つ、言語を正確な視覚的位置にグラウンディングすることをターゲットにしています。モデルはユーザーがボタン、オブジェクト、テキストブロック、視覚領域について尋ねていることを理解できますが、実際のアプリケーションではマシンが操作可能な座標、ボックス、ポイントが必要です。
従来のビジョンと言語のグラウンディングモデルは、バウンディングボックスの座標をトークンごとに生成することが多く、ボックスの幾何学とテキスト生成の逐次的な性質との間にミスマッチが生じます。LocateAnythingはボックスやポイントを完全な単位として扱うことでデコーディング戦略を変え、より並列性と幾何学的一貫性を向上させています。
この結果は、視覚エージェント、ドキュメントAI、UI自動化、ロボティクス、検査システムを構築する開発者にとって重要です。モデルがターゲットを正確かつ迅速に特定できれば、クリック、検査、注釈、カウント、ナビゲート、物理的およびデジタル世界での行動を必要とするエージェントの知覚層としてより有用になります。


