
英伟达 8 月 11 日发布 Nemotron 3.5 Lightning,一个 300 亿参数的混合专家(MoE)开源模型。据英伟达官方博客,它的定位是「长时运行智能体的高频执行层」——不是承担最复杂推理的旗舰,而是把大量重复、明确的子任务跑得又快又稳。官方给出的数字是:输出速度最高可达同级模型的 4 倍,智能体任务整体完成速度快 30%。
模型已在 Hugging Face、ModelScope、OpenRouter 与 build.nvidia.com 上线,后者以 NIM 微服务形式提供,并同步接入英伟达云合作伙伴、后训练与推理平台。
同日开源的 NeMo Switchyard 是一个路由库:把每个请求分派给开发者自有模型池中最合适的那一个,池子里可以同时有开源、闭源与英伟达模型。英伟达称这种「大模型兜底、小模型执行」的组合能在保持前沿模型精度的同时,把任务完成成本降到单独使用旗舰模型的约三分之一。执行层小模型 + 路由层的分工,正在成为智能体系统降本的通用做法。



