智能代理工作负载不是单次提示,而是数小时的工具调用、检索跳转、错误恢复和记忆更新。Nemotron 3.5 Lightning 针对这些持久、迭代的步骤,采用了 30B 专家混合设计,每个令牌激活较小的参数子集,在工作点提供更高吞吐量和更低延迟。你无需将每次调用都推送到昂贵的前沿模型,而是保持大部分循环本地快速执行,仅在准确性真正需要时才升级。
Lightning 的价值更多体现在架构层面而非头条基准:开放权重和训练方案支持领域适配;NV 友好的检查点和社区格式支持广泛的运行时选择;速度对于排队延迟累积的长链尤为重要。实际效果是代码审查、客户支持、遥测分诊和工具执行的步骤时间更稳定,随着上下文窗口增长,完成时间的方差更低。模型的 MoE 结构使其在代理持有大工作上下文时,能在不饱和内存的情况下维持高令牌速率。
生态信号同样重要:Lightning 可在消费级 GPU 上本地推理,扩展到工作站和桌面设备,甚至集群和云端。配合路由——确保正确步骤命中合适模型——你可以在设备上保持私有上下文,同时保持强大的任务完成度。对于领导者和构建者,下一步是运营:定义代理循环的服务级别,衡量每个解决工单或合并 PR 的成本,并针对你的工具、数据和编码规范微调 Lightning。


