La idea central de NeoMME es la contención arquitectónica al servicio de la recuperación. Un único transformador bidireccional ingiere tokens de texto multilingües junto con parches de imagen en bruto de 32×32, eliminando la torre visual separada y el decodificador causal comunes en pilas estilo VLM. Entrenado desde cero con un objetivo de enmascaramiento y denoising, la variante de 260M devuelve incrustaciones densas y de interacción tardía en una sola pasada. En la práctica, esto significa menos componentes en la inferencia, presupuestos de latencia más ajustados y una escalabilidad más sencilla. Con entradas emparejadas de 2048×2048, el modelo codifica alrededor de 51 páginas por segundo en una L40S, aproximadamente el doble del rendimiento de recuperadores visuales de documentos ampliamente usados, manteniendo la calidad de recuperación competitiva para búsquedas y pipelines RAG del mundo real.
¿Por qué es importante esto para la búsqueda empresarial? La mayoría de los pipelines de documentos aún dependen del OCR para extraer fragmentos de texto y luego intentan reconstruir la semántica del diseño de la página aguas abajo. NeoMME invierte eso: recupera directamente sobre imágenes de páginas, preservando tablas, gráficos y señales tipográficas que el OCR tiende a aplanar. El diseño de doble cabeza ofrece flexibilidad en el flujo de trabajo: usa vectores densos para una recuperación rápida vía ANN, luego aplica interacción tardía para capturar coincidencias token-región sin cargar un segundo modelo. Con una ventana de contexto de 16k, resolución de imagen dinámica y características modernas del codificador, NeoMME concentra el presupuesto de parámetros donde la recuperación más lo necesita: documentos de contexto largo, alta resolución y consultas multilingües.
La precisión de la interacción tardía históricamente implicaba un alto costo de almacenamiento. Las páginas de alta resolución pueden generar miles de vectores por documento y megabytes de huella por página en el índice. NeoMME mitiga esto combinando agrupamiento jerárquico de tokens (para reducir la cantidad de vectores) y cuantización asimétrica (para comprimir los vectores de documentos más agresivamente que las consultas). Con configuraciones medidas, la huella cae de megabytes por página a decenas de kilobytes, llegando a unos 6 kB por página en un ajuste más agresivo, mientras conserva la gran mayoría de la calidad base de recuperación. La conclusión: puedes permitirte la interacción tardía donde importa, incluso a escala, sin romper los presupuestos de almacenamiento.
Para los desarrolladores, el cálculo de despliegue cambia. Las velocidades de indexación cercanas a 51 páginas por segundo por GPU acortan radicalmente el tiempo hasta la búsqueda para grandes archivos y reducen los costos continuos de actualización del corpus. Una pasada hacia adelante produce tanto incrustaciones densas como de interacción tardía, por lo que puedes estandarizar tu pipeline y aplazar las compensaciones a la capa de índice. Ajusta con Sentence Transformers para cabezas densas o de interacción tardía específicas de dominio, o mantén el punto de control generalista y confía en la compresión para equilibrar costo y relevancia. En RAG visual, recupera primero imágenes de páginas y luego pasa las páginas top-k a un VLM solo para generación de respuestas, trasladando la mayor parte del trabajo pesado a un codificador nativo de recuperación y ligero.


