NeoMME 的核心理念是通过架构简化来服务检索。一个单一的双向变换器同时接收多语言文本标记和原始 32×32 图像块,摒弃了 VLM 风格堆栈中常见的独立视觉塔和因果解码器。该 260M 版本从零开始训练,采用掩码去噪目标,单次运行即可返回密集和后期交互嵌入。实际上,这意味着推理时组件更少,延迟预算更紧凑,扩展更简单。在匹配的 2048×2048 输入下,该模型在 L40S 上每秒编码约 51 页,吞吐量约为广泛使用的视觉文档检索器的两倍,同时保持在真实世界搜索和 RAG 流水线中的检索质量竞争力。
这对企业搜索为何重要?大多数文档流水线仍依赖 OCR 提取文本块,然后尝试在下游重建页面布局语义。NeoMME 颠覆了这一点:它直接对页面图像进行检索,保留了 OCR 往往会扁平化的表格、图表和排版线索。双头设计提供了工作流灵活性:使用密集向量通过 ANN 快速召回,再应用后期交互捕捉标记到区域的匹配,无需加载第二个模型。凭借 16k 上下文窗口、动态图像分辨率和现代编码器特性,NeoMME 将参数预算集中在检索最受益的长上下文、高分辨率文档和多语言查询上。
后期交互的准确性历来伴随着高昂的存储成本。高分辨率页面每个文档可能产生数千个向量,每页索引占用数兆字节。NeoMME 通过结合分层标记池化(减少向量数量)和非对称量化(对文档向量进行比查询更激进的压缩)来缓解这一问题。经过测量的配置下,存储从每页数兆字节降至数十千字节——在更激进的设置中降至约 6 KB 每页——同时保留了绝大多数基线检索质量。结论是:即使在大规模下,也能在关键位置使用后期交互,而不会突破存储预算。
对于开发者来说,部署计算方式发生了变化。每 GPU 约 51 页每秒的索引速度极大缩短了大型档案的搜索准备时间,并降低了持续的语料库刷新成本。一次前向传播即可产生密集和后期交互嵌入,您可以标准化流水线,将权衡推迟到索引层。可通过 Sentence Transformers 微调领域特定的密集或后期交互头,或保持通用检查点,依靠压缩平衡成本与相关性。在视觉 RAG 中,先检索页面图像,再将前 k 页传递给 VLM 生成答案——将大部分繁重工作转移到轻量级、检索原生的编码器上。


