NVIDIA LocateAnything utilise le décodage parallèle des boîtes pour localiser objets, éléments GUI, texte et régions visuelles plus rapidement que les modèles d'ancrage token par token.
NVIDIA LocateAnything cible l'un des problèmes les plus pratiques en IA multimodale : ancrer le langage dans des emplacements visuels précis. Un modèle peut comprendre qu'un utilisateur parle d'un bouton, d'un objet, d'un bloc de texte ou d'une région visuelle, mais les applications réelles ont besoin de coordonnées, de boîtes ou de points sur lesquels les machines peuvent agir.
Les modèles traditionnels d'ancrage vision-langage génèrent souvent les coordonnées des boîtes englobantes token par token. Cela crée un décalage entre la géométrie d'une boîte et la nature séquentielle de la génération de texte. LocateAnything modifie la stratégie de décodage en traitant une boîte ou un point comme une unité complète, permettant plus de parallélisme et une meilleure cohérence géométrique.
Le résultat est important pour les développeurs construisant des agents visuels, de l'IA documentaire, de l'automatisation d'interface utilisateur, de la robotique et des systèmes d'inspection. Si un modèle peut localiser des cibles avec précision et rapidité, il devient plus utile comme couche de perception pour des agents qui doivent cliquer, inspecter, annoter, compter, naviguer ou agir dans le monde physique et numérique.
Pourquoi l'ancrage visuel est important pour les agents IA
Un modèle vision-langage qui se contente de décrire une image est utile, mais un agent a besoin de plus que la description. Il doit savoir où se trouve quelque chose. Les agents GUI doivent localiser icônes et boutons, les agents documentaires doivent trouver tables et régions de texte, et les systèmes robotiques doivent identifier les objets dans des scènes encombrées.
LocateAnything est conçu pour cette couche orientée action. Il prend en charge des tâches telles que la détection d'objets à ensemble ouvert, la localisation dense multi-objets, l'ancrage d'expressions référentielles, l'ancrage d'éléments GUI, la localisation OCR, l'ancrage de mise en page et la localisation basée sur des points. Cela le rend pertinent tant pour l'intelligence d'entreprise que pour l'IA physique.
Le décodage parallèle des boîtes est le changement technique clé
L'innovation principale est le décodage parallèle des boîtes. Au lieu de sérialiser une boîte englobante en plusieurs tokens de coordonnées, le modèle prédit l'ensemble complet des coordonnées simultanément. Cela correspond mieux à la structure de la géométrie visuelle, où les coins d'une boîte sont liés plutôt qu'indépendants comme des fragments de texte.
NVIDIA décrit également des modes d'inférence flexibles. Le mode rapide privilégie le débit, le mode lent utilise un décodage autorégressif plus traditionnel pour la stabilité, et le mode hybride peut basculer lorsque les sorties deviennent ambiguës ou structurellement peu fiables. Cela offre aux développeurs un contrôle pratique entre vitesse et précision.
Où LocateAnything pourrait être utile
Pour l'automatisation GUI, LocateAnything peut aider un agent à comprendre où cliquer ou inspecter sur un écran. Pour l'IA documentaire, il peut localiser texte, blocs de mise en page et tables. Pour la robotique et l'inspection industrielle, il peut soutenir la localisation d'objets dans des environnements encombrés où les limites précises comptent.
Le modèle est aussi pertinent pour l'étiquetage de jeux de données et les flux de travail d'annotation. Si les développeurs peuvent ancrer des requêtes en langage naturel dans des boîtes ou points précis, ils peuvent accélérer la création de données d'entraînement pour la détection, l'OCR, la recherche visuelle et les systèmes d'agents incarnés.
Le modèle est disponible, mais pas un plug-in commercial simple
LocateAnything-3B est disponible sur Hugging Face avec des exemples pour Transformers, vLLM, SGLang et un déploiement style Docker. Cela le rend accessible aux chercheurs et développeurs souhaitant tester la performance d'ancrage dans des pipelines multimodaux locaux ou serveur.
Cependant, la fiche modèle indique que la version est destinée à la recherche et au développement sous une licence non commerciale NVIDIA. Les équipes doivent lire attentivement la licence avant de l'utiliser dans un produit, une fonctionnalité client ou un flux d'automatisation commercial.