Les charges de travail agentiques ne se limitent pas à une simple requête — elles impliquent des heures d’appels d’outils, de sauts de récupération, de gestion d’erreurs et de mises à jour de mémoire. Nemotron 3.5 Lightning cible ces étapes durables et itératives avec une architecture mixture‑of‑experts de 30 milliards de paramètres qui active un sous-ensemble réduit de paramètres par token, offrant un débit plus élevé et une latence réduite au point d’exécution. Plutôt que d’envoyer chaque appel à un modèle de pointe coûteux, vous maintenez la majorité de la boucle locale et rapide, en escaladant uniquement lorsque la précision l’exige vraiment.
La valeur de Lightning est plus architecturale que liée aux benchmarks : les poids et recettes ouverts permettent une adaptation au domaine ; les checkpoints optimisés NV et les formats communautaires offrent un large choix d’exécutions ; et la rapidité est cruciale pour les longues chaînes où les délais d’attente s’accumulent. Concrètement, cela signifie des temps d’étape plus constants pour la revue de code, le support client, le tri de télémétrie et l’exécution d’outils, ainsi qu’une variance réduite du temps d’achèvement à mesure que les fenêtres contextuelles s’allongent. La structure MoE du modèle facilite le maintien de hauts débits de tokens sans saturer la mémoire lorsque les agents conservent de larges contextes de travail.
Le signal écosystémique est tout aussi important : Lightning s’intègre à l’inférence locale sur GPU grand public, s’adapte aux stations de travail et aux serveurs de bureau, et s’étend aux clusters et au cloud. Associé au routage — pour que chaque étape atteigne le modèle adéquat — vous pouvez garder le contexte privé sur l’appareil tout en assurant une forte complétion des tâches. Pour les décideurs et développeurs, la prochaine étape est opérationnelle : définir les niveaux de service pour les boucles d’agents, mesurer le coût par ticket résolu ou PR fusionnée, et affiner Lightning selon vos outils, données et conventions de codage.


