NeoMME의 핵심 아이디어는 검색을 위한 아키텍처적 절제입니다. 하나의 양방향 트랜스포머가 다국어 텍스트 토큰과 원시 32×32 이미지 패치를 함께 처리하며, VLM 스타일 스택에서 흔히 사용되는 별도의 비전 타워와 인과 디코더를 제거했습니다. 마스크된 노이즈 제거 목표로 처음부터 학습된 2억 6천만 파라미터 모델은 한 번의 패스로 밀집 및 후기 상호작용 임베딩을 반환합니다. 실제로 이는 추론 시 움직이는 부품이 줄어들고, 지연 시간이 단축되며, 확장이 간단해진다는 의미입니다. 2048×2048 크기의 입력에 대해 L40S에서 초당 약 51페이지를 인코딩하여, 널리 사용되는 시각 문서 검색기 대비 약 2배의 처리량을 제공하면서도 실제 검색 및 RAG 파이프라인에서 경쟁력 있는 검색 품질을 유지합니다.
기업 검색에서 이것이 중요한 이유는 무엇일까요? 대부분의 문서 파이프라인은 여전히 OCR에 의존해 텍스트 조각을 추출한 후, 페이지의 레이아웃 의미를 하류에서 재구성하려고 합니다. NeoMME는 이를 뒤집어 페이지 이미지를 직접 검색하여 OCR이 평면화하는 경향이 있는 표, 그래프, 타이포그래피 단서를 보존합니다. 이중 헤드 설계는 워크플로우 유연성을 제공합니다: 빠른 검색을 위한 밀집 벡터를 사용하고, 두 번째 모델을 로드하지 않고도 토큰과 영역 간 매칭을 포착하는 후기 상호작용을 적용할 수 있습니다. 16k 컨텍스트 윈도우, 동적 이미지 해상도, 최신 인코더 기능을 갖춘 NeoMME는 검색에 가장 유리한 부분인 긴 컨텍스트, 고해상도 문서, 다국어 쿼리에 파라미터 예산을 집중합니다.
후기 상호작용 정확도는 전통적으로 높은 저장 비용을 수반했습니다. 고해상도 페이지는 문서당 수천 개의 벡터와 페이지당 메가바이트 단위의 인덱스 용량을 초래할 수 있습니다. NeoMME는 계층적 토큰 풀링(벡터 수 감소)과 비대칭 양자화(쿼리보다 문서 벡터를 더 강력하게 압축)를 결합해 이를 완화합니다. 측정된 구성에서, 저장 용량은 페이지당 대략 메가바이트에서 수십 킬로바이트로 줄어들며, 더 공격적인 설정에서는 약 6kB까지 감소하면서도 대부분의 기준 검색 품질을 유지합니다. 결론은, 저장 용량 한도를 넘지 않고도 규모에 맞게 중요한 곳에 후기 상호작용을 적용할 수 있다는 점입니다.
개발자에게 배포 계산법이 바뀝니다. GPU당 초당 약 51페이지의 인덱싱 속도는 대규모 아카이브의 검색 시작 시간을 획기적으로 단축하고 지속적인 코퍼스 갱신 비용을 줄입니다. 한 번의 순전파로 밀집 및 후기 상호작용 임베딩을 모두 생성하므로 파이프라인을 표준화하고 인덱스 계층에서 트레이드오프를 미룰 수 있습니다. 도메인 특화 밀집 또는 후기 상호작용 헤드를 위해 Sentence Transformers로 미세 조정하거나, 일반 체크포인트를 유지하며 압축으로 비용과 관련성을 균형 있게 조절할 수 있습니다. 시각적 RAG에서는 먼저 페이지 이미지를 검색한 후 상위 k개 페이지를 VLM에 전달해 답변 생성을 수행하며, 대부분의 무거운 작업을 경량 검색 네이티브 인코더에 맡깁니다.


