面向持续运行智能体,英伟达推出开源大模型 Nemotron3.5 Lightning

8 月 11 日,英伟达正式对外发布 Nemotron 3.5 Lightning 开源大模型,该模型总参数量 30B,采用混合专家 MoE 架构,单 token 仅激活 3B 参数,主打高吞吐、低延迟的 AI Agent 任务,面向本地终端、工作站以及数据中心多场景部署NVIDIA。本次开源放出模型权重、训练配方,采用 OpenMDW‑1.1 宽松许可协议,开发者可以直接进行微调、二次开发与私有化部署。

Nemotron 3.5 Lightning 定位并非全能通用大模型,而是长驻式 AI 智能体内部的执行层主力模型。在 Agent 工作链路中,大量工作集中在工具调用、结果校验、子任务分发等重复性步骤,如果全部交由超大规模推理模型处理,会带来高昂算力开销与推理延迟,这款模型就是为承接这类高频任务打造NVIDIA。

硬件层面,该模型适配范围较广,可在 RTX 消费级 PC、专业工作站、DGX 系列服务器以及云端环境运行,支持 NVFP4、BF16 量化,搭配推测解码技术,输出速度相比同级别开源模型最高提升 4 倍,任务整体完成速度提升 30%,上下文窗口最高支持 100 万 token,足以承载多轮 Agent 任务完整历史记录NVIDIA。

伴随模型同步推出 NeMo Switchyard 开源路由组件,开发者可以搭建多模型协同系统。复杂决策交给高阶大模型处理,工具调用、数据整理等标准化工作交由 Nemotron3.5 Lightning 执行,组件会自动完成任务分流,无需大规模改写原有应用代码,降低多模型架构的落地门槛NVIDIA。该模型已经登陆 Ollama、Ubuntu 等平台,开发者可以通过简单命令快速完成部署调试。

从技术路线来看,英伟达 Nemotron 系列持续完善分层模型矩阵,不同规格模型分别承担复杂推理、高速执行等差异化职责。过去 AI 开发普遍依赖单一大模型完成全部工作,多模型分工执行正在成为 Agent 领域新的技术方向。Nemotron3.5 Lightning 的出现,补齐高速执行侧的开源方案,降低企业搭建自主 Agent 系统的成本。

行业层面,AI Agent 应用快速发展,市场对低成本、可本地部署、可定制的开源模型需求持续上涨。传统大模型参数量庞大,本地硬件运行压力高,而 MoE 架构做到总参数规模大,但实际运算激活参数更小,兼顾能力与推理速度,成为当下重要技术路线。

当然该模型聚焦任务执行环节,复杂逻辑推理能力不及同系列高阶版本,更适合嵌入整套 Agent 系统作为工作单元,并不适合单独作为通用对话模型使用。后续开发者可以基于开源材料做领域微调,适配企业业务流程。随着开源生态持续完善,Nemotron3.5 Lightning 有望推动本地、私有化部署的 AI Agent 应用进一步普及。