NeoMME 的核心理念是以架構節制來服務檢索。一個雙向 Transformer 同時接收多語言文本標記與原始 32×32 圖像區塊,捨棄了 VLM 類堆疊中常見的獨立視覺塔與因果解碼器。260M 版本從零開始訓練,採用遮蔽去噪目標,一次輸出密集與後期交互嵌入。實務上,這意味著推理時零件更少、延遲預算更緊湊且擴展更簡單。在匹配的 2048×2048 輸入下,該模型在 L40S 上每秒編碼約 51 頁,吞吐量約為廣泛使用的視覺文件檢索器的兩倍,同時保持實際搜尋與 RAG 流程中具競爭力的檢索品質。
這對企業搜尋有何意義?大多數文件流程仍依賴 OCR 來擷取文本區塊,然後嘗試在後端重建頁面版面語義。NeoMME 則顛覆此法:直接對頁面影像進行檢索,保留 OCR 容易扁平化的表格、圖表與排版線索。雙頭設計提供工作流程彈性:使用密集向量快速召回(ANN),再用後期交互捕捉標記與區域匹配,無需載入第二個模型。配合 16k 上下文視窗、動態圖像解析度與現代編碼器特性,NeoMME 將參數預算集中於檢索最有利的長上下文、高解析度文件與多語言查詢。
後期交互的準確度歷來伴隨高昂的存儲成本。高解析度頁面每份文件可產生數千向量,且每頁索引佔用數兆位元組。NeoMME 透過結合分層標記池化(減少向量數量)與非對稱量化(對文件向量壓縮比查詢更激進)來緩解此問題。經測試配置,索引大小從每頁數兆位元組降至數十千位元組,在更激進設定下約為每頁 6 kB,同時保留大部分基線檢索品質。結論是:即使在大規模環境,也能在重要環節使用後期交互而不超出存儲預算。
對開發者而言,部署計算方式改變。每 GPU 每秒約 51 頁的索引速度大幅縮短大型檔案庫的搜尋啟動時間,並降低持續更新成本。一次前向傳播同時產生密集與後期交互嵌入,可標準化流程並將取捨延後至索引層。可用 Sentence Transformers 微調領域專用的密集或後期交互頭,或保留通用檢查點並依靠壓縮平衡成本與相關性。在視覺 RAG 中,先檢索頁面影像,再將前 k 頁傳給 VLM 生成答案,將大部分運算負擔轉移至精簡且原生檢索的編碼器。


