A ideia central do NeoMME é a contenção arquitetônica a serviço da recuperação. Um único Transformador bidirecional ingere tokens de texto multilíngue junto com patches brutos de imagem 32×32, eliminando a torre visual separada e o decodificador causal comuns em pilhas do tipo VLM. Treinado do zero com um objetivo de denoising mascarado, a variante de 260M retorna embeddings densos e de interação tardia em uma única passagem. Na prática, isso significa menos componentes em inferência, orçamentos de latência mais apertados e escalabilidade simplificada. Com entradas correspondentes de 2048×2048, o modelo codifica cerca de 51 páginas por segundo em uma L40S — aproximadamente o dobro da taxa de recuperadores visuais de documentos amplamente usados — mantendo a qualidade de recuperação competitiva para buscas reais e pipelines RAG.
Por que isso importa para a busca empresarial? A maioria dos pipelines de documentos ainda depende de OCR para extrair blocos de texto, tentando depois reconstruir a semântica do layout da página. O NeoMME inverte isso: ele recupera diretamente nas imagens das páginas, preservando tabelas, gráficos e pistas tipográficas que o OCR tende a achatar. O design de dupla cabeça oferece flexibilidade no fluxo de trabalho: use vetores densos para recall rápido via ANN e depois aplique interação tardia para capturar correspondências token-região sem carregar um segundo modelo. Com uma janela de contexto de 16k, resolução dinâmica de imagem e recursos modernos de codificação, o NeoMME concentra o orçamento de parâmetros onde a recuperação mais se beneficia: contexto longo, documentos de alta resolução e consultas multilíngues.
A precisão da interação tardia historicamente vinha com um alto custo de armazenamento. Páginas em alta resolução podem gerar milhares de vetores por documento e megabytes de índice por página. O NeoMME mitiga isso combinando pooling hierárquico de tokens (para reduzir o número de vetores) e quantização assimétrica (para comprimir vetores de documentos mais agressivamente que os de consultas). Com configurações medidas, o espaço ocupado cai de megabytes por página para dezenas de kilobytes — chegando a cerca de 6 kB por página em uma configuração mais agressiva — enquanto mantém a maior parte da qualidade de recuperação da base. A conclusão: você pode usar interação tardia onde importa, mesmo em escala, sem estourar o orçamento de armazenamento.
Para desenvolvedores, o cálculo de implantação muda. Velocidades de indexação próximas a 51 páginas por segundo por GPU reduzem radicalmente o tempo até a busca para grandes arquivos e diminuem os custos contínuos de atualização do corpus. Uma única passagem gera embeddings densos e de interação tardia, permitindo padronizar seu pipeline e adiar trade-offs para a camada de índice. Faça fine-tuning com Sentence Transformers para cabeças densas ou de interação tardia específicas de domínio, ou mantenha o checkpoint generalista e confie na compressão para equilibrar custo e relevância. No RAG visual, recupere imagens de páginas primeiro e depois passe as páginas top-k para um VLM apenas para geração de respostas — transferindo a maior parte do trabalho pesado para um codificador enxuto e nativo para recuperação.


