NVIDIA LocateAnything 針對多模態 AI 中最實用的問題之一:將語言定位於精確的視覺位置。模型可能理解使用者在詢問按鈕、物件、文字區塊或視覺區域,但實際應用需要機器能操作的座標、框或點。
傳統的視覺語言定位模型通常逐字生成邊界框座標,這造成框的幾何形狀與文字生成的序列性不匹配。LocateAnything 改變了解碼策略,將框或點視為完整單元,允許更多平行處理並提升幾何一致性。
這對開發視覺代理、文件 AI、UI 自動化、機器人和檢測系統的開發者來說非常重要。如果模型能準確且快速定位目標,便能成為需要點擊、檢查、註解、計數、導航或在實體與數位世界中行動的代理的感知層。


