NeoMMEの核となるアイデアは、リトリーバルに特化したアーキテクチャの抑制です。単一の双方向トランスフォーマーが多言語テキストトークンと32×32の生画像パッチを同時に取り込み、VLMスタイルのスタックで一般的な別個のビジョンタワーや因果デコーダーを排除しています。マスク付きノイズ除去目的でスクラッチから訓練された260Mバリアントは、一度の処理で密な埋め込みと後期相互作用埋め込みを返します。実際には、推論時の部品点数が減り、レイテンシーの予算が厳しくなり、スケーリングが簡単になります。2048×2048の入力で比較すると、L40S上で約51ページ/秒をエンコードし、広く使われている視覚的ドキュメントリトリーバーの約2倍のスループットを実現しつつ、実際の検索やRAGパイプラインで競争力のあるリトリーバル品質を維持しています。
なぜこれがエンタープライズ検索に重要なのでしょうか?多くのドキュメントパイプラインは依然としてOCRに依存してテキストチャンクを抽出し、その後でページのレイアウト意味を再構築しようとします。NeoMMEはこれを逆転させ、ページ画像上で直接リトリーブし、OCRが平坦化しがちな表、グラフ、タイポグラフィの手がかりを保持します。デュアルヘッド設計によりワークフローの柔軟性を提供し、高速なANNによるリコールには密ベクトルを使用し、後期相互作用でトークンと領域のマッチングを捉えつつ、別のモデルを読み込む必要がありません。16kのコンテキストウィンドウ、動的な画像解像度、最新のエンコーダ機能により、NeoMMEはリトリーバルに最も効果的な長いコンテキスト、高解像度ドキュメント、多言語クエリにパラメータ予算を集中させています。
後期相互作用の精度は従来、膨大なストレージコストを伴いました。高解像度ページはドキュメントごとに数千のベクトルを生み出し、ページごとのインデックスフットプリントはメガバイト単位に達します。NeoMMEは階層的トークンプーリング(ベクトル数削減)と非対称量子化(クエリよりもドキュメントベクトルをより圧縮)を組み合わせてこれを緩和します。測定された設定では、フットプリントはページあたりメガバイトから数十キロバイトに減少し、より積極的な設定では約6kBまで圧縮しつつ、ベースラインのリトリーバル品質の大部分を維持しています。つまり、ストレージ予算を破ることなく、スケール時にも重要な箇所で後期相互作用を利用できます。
開発者にとって、展開の計算が変わります。1GPUあたり約51ページ/秒のインデックス速度は、大規模アーカイブの検索開始時間を劇的に短縮し、継続的なコーパス更新コストを削減します。1回のフォワードパスで密ベクトルと後期相互作用ベクトルの両方を生成できるため、パイプラインを標準化し、トレードオフをインデックス層に委ねられます。ドメイン特化の密または後期相互作用ヘッドはSentence Transformersでファインチューニング可能で、一般的なチェックポイントを保持して圧縮でコストと関連性のバランスを取ることもできます。視覚的RAGでは、まずページ画像をリトリーブし、上位kページをVLMに渡して回答生成のみを行い、重い処理の大部分を軽量でリトリーバルに特化したエンコーダに移行します。


