产品简介
Nemotron 3.5 Lightning 是 NVIDIA 开源的混合架构模型,30B 总参数、每次推理只激活约 3B,把 Mamba-2、注意力和混合专家层拼在一条链路上,预训练用了 20 万亿 token 以上,配 NVFP4 量化配方与多 token 预测来加快生成。上下文最长可到 100 万 token,支持推理模式与工具调用,覆盖英语、编码语言以及西班牙语、法语、德语、意大利语和日语。权重按 OpenMDW License Agreement v1.1 开放。
它的定位不是单打独斗。NVIDIA 把它和 Nemotron 3 Ultra 编成一组:Ultra 是 550B 总参数、55B 激活的重型模型,负责需要长链条推理的任务;Lightning 承接工具调用、编码、结构化输出这类高频且边界清晰的 Agent 执行步骤,也适合当子智能体的常驻执行单元。
NVIDIA 公布的 BF16 基准里,MMLU Pro 81.94、GPQA Diamond 75.44、SWE-bench Verified 51.56、IFBench 71.88、AA-LCR 52.00、Terminal-Bench 2.1 为 24.58,均为厂商口径。托管 API 的挂牌价大约在每百万输入 token 0.07 至 0.08 美元、输出 0.20 美元这一档,OpenRouter 已在 9 月 22 日发文解读它在 Agent 高频执行调用里的角色。
本地部署是它另一个卖点。第三方在 RTX 5090 上实测生成速度 334 令牌每秒、128k 文档的首个 token 14.9 秒;RTX 3090 上用 GGUF 量化跑到 193.7 令牌每秒,上下文从 32k 拉到 192k 时显存只多占 1119 MiB。混合架构在长上下文上的显存效率,是它能在消费级显卡上跑起来的关键。
核心功能
- Mamba-2 混合架构:Mamba-2、注意力与混合专家层拼在一条链路上,降低每 token 计算量,长序列显存开销小。
- 30B 总参 / 3B 激活:每次推理只唤起约 3B 参数,速度与成本都压在轻量档。
- 最长 1M 上下文:长文档与长工具轨迹可以整段处理,托管端点常见配置为 262K。
- 推理与工具调用:支持推理模式和函数调用,适合当 Agent 的执行单元与子智能体常驻节点。
- OpenMDW 许可开放权重:按 OpenMDW License Agreement v1.1 开放,可自行量化部署。
- 多语言覆盖:除英语与编码语言外,覆盖西班牙语、法语、德语、意大利语和日语。
适合谁用
以下类型的用户会特别受益于 NVIDIA Nemotron 3.5 Lightning:
- Agent 高频执行步骤:工具调用、结构化输出、格式转换这类边界清晰的动作
- 子智能体执行单元:在长链路 Agent 里承担低成本的常驻执行角色
- 本地与边缘部署:消费级显卡上跑量化版本,做长文档问答与摘要
- 多语言批处理:英语之外的西法德意日内容处理
优点亮点
- 3B 激活配 Mamba-2 混合架构,生成速度快且长上下文显存占用小
- 权重按 OpenMDW 许可开放,可自行量化并在消费级显卡上部署
- 最长 1M 上下文,长文档与长工具轨迹不用切段
- 与 Nemotron 3 Ultra 组成分工,在同一条技术栈里按任务难度分配
价格与方案
托管 API 挂牌价约每百万输入 token 0.07 至 0.08 美元、输出 0.20 美元,部分网关按免费额度提供。权重按 OpenMDW License Agreement v1.1 开放,可自行部署。具体价格以各家服务商公示为准。
总结与建议
Nemotron 3.5 Lightning 是 NVIDIA 开源权重的混合架构模型,30B 总参数、约 3B 激活,把 Mamba-2、注意力与混合专家层组合起来,预训练数据超 20 万亿 token,最长支持 1M 上下文并具备推理与工具调用能力,权重按 OpenMDW 许可开放。NVIDIA 让它与 550B 的 Nemotron 3 Ultra 分工,专门承接工具调用、编码这类高频执行步骤。托管 API 约每百万输入 token 0.07 至 0.08 美元,第三方消费级显卡实测生成速度达每秒数百 token,长上下文显存占用增幅很小。
版本演进
- OpenRouter 解读 Nemotron 3.5 Lightning 在高频 Agent 执行中的角色 (2026-09-22):OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,一款 30B 总参数、约 3B 激活的混合专家开源权重模型,定位于工具调用、编码这类高频且边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。该模型采用 Mamba-2 与注意力、混合专家层组合的架构,预训练数据超过 20 万亿 token,最长支持 1M 上下文,权重按 OpenMDW License Agreement v1.1 开放。
- NVIDIA 开源 Nemotron 3.5 Lightning,30B-A3B 混合架构 (2026-08-11):NVIDIA 发布并开源 Nemotron 3.5 Lightning,30B 总参数、约 3B 激活的混合模型,架构组合 Mamba-2、注意力与混合专家层,配 NVFP4 量化配方与多 token 预测,预训练数据超 20 万亿 token,最长 1M 上下文,支持推理与工具调用,覆盖英语、编码语言及西班牙语、法语、德语、意大利语、日语,权重按 OpenMDW License Agreement v1.1 开放。NVIDIA 公布的 BF16 基准为 MMLU Pro 81.94、GPQA Diamond 75.44、SWE-bench Verified 51.56、IFBench 71.88、AA-LCR 52.00、Terminal-Bench 2.1 为 24.58。