
编译 | 茄子
编辑 | 程茜
智东西 8 月 12 日消息,昨日,英伟达发布开源大语言模型 Nemotron 3.5 Lightning,以及面向 Agent 的开源智能路由库 NeMo Switchyard。前者总参数量为 300 亿,推理时仅激活约 30 亿参数,输出速度最高达到同等规模模型的 4 倍;后者可以在多款模型之间自动分配任务,英伟达内部测试显示,其任务完成成本可降至全部使用 Claude Opus 4.8 时的 1/3。

Nemotron 3.5 Lightning 是英伟达 7 月 24 日签署支持开源 AI 模型的联名公开信后,首次推出的开源模型。
英伟达创始人兼 CEO 黄仁勋称,Nemotron 3.5 Lightning 适用于持续运行和长时间工作的 Agent,并将其概括为 " 智能、快速、高效且开源 "。

大模型测评机构 Artificial Analysis 对总参数量低于 400 亿的开放权重模型进行了比较。Nemotron 3.5 Lightning 综合能力得分为 24 分,输出速度约为 670 token/s,是图中唯一进入高速度、高得分区域的模型。

英伟达称,Nemotron 3.5 Lightning 主要承担 Agent 执行长程任务时的工具调用、结果检查、格式整理和代码操作等高频工作。在技术上,Nemotron 3.5 Lightning 结合多 token 预测、推测解码和低精度量化等技术提高推理效率。
为了进一步降低整个 Agent 工作流的运行成本,英伟达还推出 NeMo Switchyard 路由库,对不同模型进行统一调度。
据技术博客称,NeMo Switchyard 会路由库根据任务难度、模型能力、成本和延迟选择模型,将复杂规划交给能力更强的前沿模型,把工具调用、结果检查和格式整理等高频操作交给速度更快、成本更低的模型。在 LangChain 完成的 145 项多轮 Agent 任务测试中,Switchyard 仅将 7% 的请求交给前沿模型,整体成本降低 74%
此外,据外媒 The Information 昨日报道,英伟达正在研发更大规模的 Nemotron 4 系列,其最大版本预计至少拥有 1 万亿参数,目标是达到全球领先开源模型的水平。不过,该模型尚未完成最终训练,具体规格及发布时间均未确定。
目前,Nemotron 3.5 Lightning 已全面开放至 Hugging Face、ModelScope、OpenRouter 以及英伟达官方开发者平台,供开发者下载与调用,NeMo Switchyard 也已在 GitHub 开源。
Nemotron 3.5 Lightning 开源链接:
https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
NeMo Switchyard 开源链接:
https://github.com/NVIDIA-NeMo/Switchyard
一、300 亿参数每次激活 30 亿,1 万项 Agent 任务完成速度比 Qwen 3.6 快 30%
Nemotron 3.5 Lightning 采用混合专家架构。该模型包含 300 亿参数,但处理每个 token 时,路由器只会调用少量专家模块,因此每次推理激活约 30 亿参数。这种设计使模型在保留 300 亿参数总体容量的同时,减少每次推理实际参与计算的参数量,从而降低计算开销。
英伟达将 Nemotron 3.5 Lightning 定位为 Agent 执行长程任务中的工作模型,主要负责工具调用、检查工具返回结果、整理输出格式和运行代码命令等高频操作。
在这套模型分工中,Nemotron 3 Ultra 等前沿推理模型负责复杂规划和任务编排,Nemotron 3.5 Lightning 则执行数量更多、流程相对固定的具体任务。英伟达认为,如果每一步都调用前沿模型,会增加成本和延迟。
Artificial Analysis 测试显示,Nemotron 3.5 Lightning 处于同类开源模型的能力—速度 " 帕累托前沿 ",即目前没有其他参测模型能在综合能力和输出速度两项指标上同时超过它。

在更关注 Agent 实际任务完成效率的 PinchBench 测试中,Nemotron 3.5 Lightning 以 86% 的准确率完成 1 万项任务。在准确率相近的情况下,其任务完成速度比 Qwen 3.6 35B 快 30%。

英伟达称,该模型的输出速度最高可达到同等规模模型的 4 倍。不过,这一数据主要反映特定部署环境下的生成速度,并不代表 Nemotron 3.5 Lightning 在综合智能方面超过所有同规模模型。
目前,网络安全厂商 CrowdStrike、法务 AI 平台 Harvey、代码审查工具商 CodeRabbit 正分别探索将该模型用于网络安全、法律服务和代码审查;科研平台 Lila Sciences 参与提升其物理及生命科学任务的推理能力,垂直微调服务商 Fastino Labs 则针对软件开发、金融和医疗场景进行了定制。

技术方面,Nemotron 3.5 Lightning 在训练中加入多 token 预测能力,可以提前预测后续多个 token,再对预测结果进行验证。英伟达还为其提供 DSpark 和 DFlash 两款草稿模型,用于快速生成待验证内容,以进一步提高推测解码速度。
该模型同时提供 BF16 和 NVFP4 版本,可运行在 Jetson、GeForce RTX 5090 和 DGX Spark 等本地设备上,也能部署至工作站、数据中心及云环境。
Nemotron 3.5 Lightning 现已上线 Hugging Face、ModelScope、OpenRouter 和英伟达开发平台。英伟达还开源了用于强化模型编程 Agent 能力的数据集 Nemotron-RL Agentic Terminal Pivot。
二、Agent 任务按难度分配模型,合作伙伴实测成本最高降低 74%
英伟达称,Agent 执行长程任务时,通常要经历规划、检索、工具调用、结果验证和纠错等多个环节,而不同环节对模型能力、响应速度和运行成本的要求并不相同。
NeMo Switchyard 因此会结合请求内容、上下文、模型能力、运行成本和延迟,为 Agent 工作流中的不同环节选择模型。例如,复杂规划可以交给能力更强的前沿模型,工具调用和结果整理等常规步骤则可以转交给速度更快、成本更低的模型。
该工具并不局限于英伟达自己的模型,可以同时接入开源和闭源模型。开发者还可以根据准确率、速度和成本等目标调整路由策略。
NeMo Switchyard 提供多种路由方式。其中,分类路由器根据任务所属领域选择模型;阶段路由器结合 Agent 当前执行阶段及工具使用情况调整模型;升级路由器则先调用成本较低的模型。如果当前模型无法可靠完成任务,NeMo Switchyard 再交给能力更强的模型。

英伟达内部测试显示,与所有任务都使用 Claude Opus 4.8 相比,NeMo Switchyard 可以在保持接近 Claude Opus 4.8 准确率的情况下,将任务完成成本降至约三分之一。

在合作伙伴测试中,AI Agent 开发基础设施厂商 LangChain 在 145 项多轮 Agent 任务中进行了测试。Switchyard 仅将 7% 的请求发送给 Claude Opus 4.8,虽然准确率下降约 6 个百分点,但总体成本降低 74%。

软件研发 Agent 厂商 Cognition 将阶段路由方法用于 Devin Desktop 后,平均成本比全部请求使用同一前沿模型降低 28%。
金融与软件工程 AI 服务商 Ramp Labs 在自研软件工程评测基准 Ramp SWE-Bench 中完成英伟达 NeMo Switchyard 调度工具实测,并称,其测试成本降低 58%,运行时间缩短 33%。

英伟达还在与企业级 AI 网关服务商 KongKong、开源多模型统一网关厂商 LiteLLM、开源大模型与智能体研发机构 Nous Research 和西门子等企业合作,将路由能力接入 AI 网关、开发工具和企业 Agent。
三、被曝研发万亿参数模型,目标之一是扩大 GPU 需求
据 The Information 昨日报道,Nemotron 3.5 Lightning 只是英伟达扩大开源模型投入的一部分。该公司正在开发 Nemotron 4 系列,希望其性能达到全球领先开源模型的水平。
多名员工预计,Nemotron 4 最大版本可能拥有至少 1 万亿参数,规模约为 Nemotron 3 Ultra 的两倍。英伟达已经确定了部分训练数据和架构方案,但尚未完成最终训练,发布时间也没有敲定。
英伟达扩大模型投入,一方面可以用模型开发反向优化芯片和软件,另一方面也希望降低企业使用 AI 的门槛,从而扩大 GPU 需求。高质量开源模型越多,能够训练、微调和部署 AI 的企业就越多,英伟达硬件的潜在客户范围也会随之扩大。
不过,这也让英伟达与客户和投资对象之间的关系变得更加复杂。OpenAI 和 Anthropic 等前沿实验室是英伟达芯片的重要客户,Reflection AI、Thinking Machines Lab 等开源模型公司则获得过英伟达投资。英伟达亲自开发高性能模型,可能与这些企业形成直接竞争。
结语:英伟达补齐 Agent 模型调度环节
Nemotron 3.5 Lightning 与 NeMo Switchyard 分别切入 Agent 的执行和调度环节:前者承担调用频繁、强调速度的具体任务,后者根据任务难度、模型能力、成本和延迟,在多款开源及闭源模型之间分配请求。这套方案的重点不是依赖一款模型完成全部工作,而是通过多模型协作控制长程 Agent 的运行成本。
随着 Agent 从一次性问答转向持续执行搜索、编程和企业流程等任务,模型调用量及推理成本随之增加。模型路由由此成为新的基础设施环节,云厂商、模型平台和 Agent 开发工具都在尝试将不同模型接入同一套工作流,竞争重点也从单一模型能力延伸至任务分配效率和整体成本。
英伟达此次同时布局执行模型、模型路由和被曝在研的万亿参数模型,正在将业务从 GPU 进一步延伸至 Agent 技术栈。若开源模型和多模型协作得到更广泛采用,新增的训练、微调和推理需求也可能继续带动其计算平台的使用。
来源:英伟达、The Information