NVIDIA LocateAnything utiliza Decodificación Paralela de Cajas para localizar objetos, elementos de la interfaz, texto y regiones visuales más rápido que los modelos de anclaje token por token.
NVIDIA LocateAnything aborda uno de los problemas más prácticos en la IA multimodal: anclar el lenguaje en ubicaciones visuales exactas. Un modelo puede entender que un usuario está preguntando por un botón, objeto, bloque de texto o región visual, pero las aplicaciones reales necesitan coordenadas, cajas o puntos sobre los que las máquinas puedan actuar.
Los modelos tradicionales de anclaje visión-lenguaje suelen generar las coordenadas de la caja delimitadora token por token. Esto crea una descoordinación entre la geometría de una caja y la naturaleza secuencial de la generación de texto. LocateAnything cambia la estrategia de decodificación tratando una caja o punto como una unidad completa, permitiendo más paralelismo y mejor consistencia geométrica.
El resultado es importante para desarrolladores que construyen agentes visuales, IA para documentos, automatización de interfaces, robótica y sistemas de inspección. Si un modelo puede localizar objetivos de manera precisa y rápida, se vuelve más útil como capa de percepción para agentes que necesitan hacer clic, inspeccionar, anotar, contar, navegar o actuar en el mundo físico y digital.
Por qué el anclaje visual es importante para los agentes de IA
Un modelo visión-lenguaje que solo describe una imagen es útil, pero un agente necesita más que una descripción. Necesita saber dónde está algo. Los agentes GUI deben localizar iconos y botones, los agentes de documentos deben encontrar tablas y regiones de texto, y los sistemas robóticos deben identificar objetos en escenas desordenadas.
LocateAnything está diseñado para esta capa orientada a la acción. Soporta tareas como detección de objetos en conjunto abierto, localización densa de múltiples objetos, anclaje por expresiones referenciales, anclaje de elementos GUI, localización OCR, anclaje de diseño y localización basada en puntos. Esto lo hace relevante tanto para inteligencia empresarial como para IA física.
La Decodificación Paralela de Cajas es el cambio técnico clave
La innovación principal es la Decodificación Paralela de Cajas. En lugar de serializar una caja delimitadora en múltiples tokens de coordenadas, el modelo predice el conjunto completo de coordenadas de una vez. Esto se ajusta mejor a la estructura de la geometría visual, donde las esquinas de una caja están relacionadas y no son fragmentos de texto independientes.
NVIDIA también describe modos flexibles de inferencia. El modo rápido prioriza el rendimiento, el modo lento usa decodificación autoregresiva tradicional para estabilidad, y el modo híbrido puede recurrir a este último cuando las salidas se vuelven ambiguas o estructuralmente poco fiables. Esto ofrece a los desarrolladores un control práctico entre velocidad y precisión.
Dónde LocateAnything podría ser útil
Para la automatización GUI, LocateAnything puede ayudar a un agente a entender dónde hacer clic o inspeccionar en una pantalla. Para IA de documentos, puede localizar texto, bloques de diseño y tablas. Para robótica e inspección industrial, puede apoyar la localización de objetos en entornos desordenados donde los límites precisos son importantes.
El modelo también es relevante para flujos de trabajo de etiquetado y anotación de conjuntos de datos. Si los desarrolladores pueden anclar consultas en lenguaje natural en cajas o puntos precisos, pueden acelerar la creación de datos de entrenamiento para detección, OCR, búsqueda visual y sistemas de agentes incorporados.
El modelo está disponible, pero no es un complemento comercial simple
LocateAnything-3B está disponible en Hugging Face con ejemplos para Transformers, vLLM, SGLang y despliegue estilo Docker. Esto lo hace accesible para investigadores y desarrolladores que quieren probar el rendimiento del anclaje dentro de pipelines multimodales locales o basados en servidor.
Sin embargo, la tarjeta del modelo indica que la versión es para investigación y desarrollo bajo una licencia no comercial de NVIDIA. Los equipos deben leer la licencia cuidadosamente antes de usarlo en un producto, función orientada al cliente o flujo de trabajo comercial automatizado.