Khối lượng công việc tác nhân không chỉ là một lệnh đơn lẻ — mà là hàng giờ gọi công cụ, truy xuất dữ liệu, phục hồi lỗi và cập nhật bộ nhớ. Nemotron 3.5 Lightning hướng đến những bước lặp bền bỉ này với thiết kế hỗn hợp chuyên gia 30B kích hoạt một tập con nhỏ các tham số cho mỗi token, giúp bạn đạt thông lượng cao hơn và độ trễ thấp hơn tại điểm làm việc. Thay vì đẩy mọi cuộc gọi đến một mô hình tiên phong đắt đỏ, bạn giữ phần lớn vòng lặp ở cục bộ và nhanh chóng, chỉ tăng cấp khi độ chính xác thực sự cần thiết.
Giá trị của Lightning nằm nhiều ở kiến trúc hơn là điểm chuẩn nổi bật: trọng số và công thức huấn luyện mở cho phép tùy chỉnh theo lĩnh vực; các điểm kiểm tra thân thiện với NV và định dạng cộng đồng cho phép lựa chọn môi trường chạy rộng rãi; và tốc độ đặc biệt quan trọng với các chuỗi dài nơi độ trễ xếp hàng cộng dồn. Về mặt thực tiễn, điều này có nghĩa là thời gian bước ổn định hơn cho đánh giá mã, hỗ trợ khách hàng, phân loại dữ liệu giám sát và thực thi công cụ, cùng với độ biến thiên thấp hơn về thời gian hoàn thành khi cửa sổ ngữ cảnh mở rộng. Cấu trúc MoE của mô hình giúp duy trì tốc độ token cao mà không làm bão hòa bộ nhớ khi tác nhân giữ các ngữ cảnh làm việc lớn.
Tín hiệu từ hệ sinh thái cũng quan trọng không kém: Lightning phù hợp với suy luận cục bộ trên GPU tiêu dùng, mở rộng đến các máy trạm và thiết bị bàn làm việc, và lan tỏa đến các cụm và đám mây. Kết hợp với định tuyến — để bước phù hợp được xử lý bởi mô hình phù hợp — bạn có thể giữ ngữ cảnh riêng tư trên thiết bị trong khi vẫn duy trì hiệu quả hoàn thành nhiệm vụ. Với các nhà lãnh đạo và nhà phát triển, bước tiếp theo là vận hành: xác định mức dịch vụ cho vòng lặp tác nhân, đo chi phí cho mỗi vé được giải quyết hoặc PR được gộp, và tinh chỉnh Lightning phù hợp với công cụ, dữ liệu và quy ước mã hóa của bạn.


