NVIDIA LocateAnything sử dụng Phân Giải Hộp Song Song để định vị đối tượng, thành phần giao diện người dùng, văn bản và vùng hình ảnh nhanh hơn so với các mô hình định vị từng token một.
NVIDIA LocateAnything hướng tới một trong những vấn đề thực tiễn nhất trong AI đa phương thức: định vị ngôn ngữ tại các vị trí hình ảnh chính xác. Một mô hình có thể hiểu rằng người dùng đang hỏi về một nút bấm, đối tượng, khối văn bản hoặc vùng hình ảnh, nhưng các ứng dụng thực tế cần tọa độ, hộp hoặc điểm mà máy móc có thể thao tác.
Các mô hình định vị ngôn ngữ-thị giác truyền thống thường tạo ra tọa độ hộp giới hạn từng token một. Điều này tạo ra sự không khớp giữa hình học của hộp và tính tuần tự của việc tạo văn bản. LocateAnything thay đổi chiến lược giải mã bằng cách coi một hộp hoặc điểm là một đơn vị hoàn chỉnh, cho phép song song hóa nhiều hơn và độ nhất quán hình học tốt hơn.
Kết quả này rất quan trọng đối với các nhà phát triển xây dựng các tác nhân thị giác, AI tài liệu, tự động hóa giao diện người dùng, robot và hệ thống kiểm tra. Nếu một mô hình có thể định vị mục tiêu chính xác và nhanh chóng, nó trở nên hữu ích hơn như một lớp nhận thức cho các tác nhân cần nhấp, kiểm tra, chú thích, đếm, điều hướng hoặc hành động trong thế giới vật lý và kỹ thuật số.
Tại sao định vị hình ảnh lại quan trọng với các tác nhân AI
Một mô hình ngôn ngữ-thị giác chỉ mô tả hình ảnh thì hữu ích, nhưng một tác nhân cần nhiều hơn mô tả. Nó cần biết vị trí của một thứ gì đó. Các tác nhân giao diện người dùng phải định vị biểu tượng và nút bấm, các tác nhân tài liệu phải tìm bảng và vùng văn bản, và các hệ thống robot phải nhận diện đối tượng trong các cảnh lộn xộn.
LocateAnything được thiết kế cho lớp hành động này. Nó hỗ trợ các nhiệm vụ như phát hiện đối tượng mở, định vị nhiều đối tượng dày đặc, định vị theo biểu thức tham chiếu, định vị thành phần giao diện người dùng, định vị OCR, định vị bố cục và định vị dựa trên điểm. Điều này làm cho nó phù hợp với cả trí tuệ doanh nghiệp và AI vật lý.
LocateAnything có thể hữu ích ở đâu
Đối với tự động hóa giao diện người dùng, LocateAnything có thể giúp tác nhân hiểu nơi cần nhấp hoặc kiểm tra trên màn hình. Đối với AI tài liệu, nó có thể định vị văn bản, khối bố cục và bảng biểu. Đối với robot và kiểm tra công nghiệp, nó hỗ trợ định vị đối tượng trong môi trường lộn xộn nơi ranh giới chính xác rất quan trọng.
Mô hình cũng phù hợp cho quy trình gán nhãn và chú thích bộ dữ liệu. Nếu các nhà phát triển có thể định vị các truy vấn ngôn ngữ tự nhiên thành các hộp hoặc điểm chính xác, họ có thể tăng tốc tạo dữ liệu huấn luyện cho phát hiện, OCR, tìm kiếm hình ảnh và hệ thống tác nhân thể hiện.
Mô hình đã có sẵn, nhưng không phải là plugin thương mại đơn giản
LocateAnything-3B có sẵn trên Hugging Face với các ví dụ cho Transformers, vLLM, SGLang và triển khai kiểu Docker. Điều này giúp các nhà nghiên cứu và phát triển dễ dàng thử nghiệm hiệu suất định vị trong các pipeline đa phương thức cục bộ hoặc máy chủ.
Tuy nhiên, thẻ mô hình ghi rõ phát hành dành cho nghiên cứu và phát triển theo giấy phép phi thương mại của NVIDIA. Các nhóm nên đọc kỹ giấy phép trước khi sử dụng trong sản phẩm, tính năng hướng đến khách hàng hoặc quy trình tự động hóa thương mại.