ChengRang
EN

NVIDIA Nemotron 3.5 Lightning 热门 新增

AI 开发平台 免费

NVIDIA 开源权重的混合架构模型,30B 总参数约 3B 激活,最高 100 万 token 上下文并支持工具调用,面向高频 Agent 执行步骤与本地部署

NVIDIA MoE Mamba 开源 工具调用
访问 NVIDIA Nemotron 3.5 Lightning 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

Nemotron 3.5 Lightning 是 NVIDIA 开源的混合架构模型,30B 总参数、每次推理只激活约 3B,把 Mamba-2、注意力和混合专家层拼在一条链路上,预训练用了 20 万亿 token 以上,配 NVFP4 量化配方与多 token 预测来加快生成。上下文最长可到 100 万 token,支持推理模式与工具调用,覆盖英语、编码语言以及西班牙语、法语、德语、意大利语和日语。权重按 OpenMDW License Agreement v1.1 开放。

它的定位不是单打独斗。NVIDIA 把它和 Nemotron 3 Ultra 编成一组:Ultra 是 550B 总参数、55B 激活的重型模型,负责需要长链条推理的任务;Lightning 承接工具调用、编码、结构化输出这类高频且边界清晰的 Agent 执行步骤,也适合当子智能体的常驻执行单元。

NVIDIA 公布的 BF16 基准里,MMLU Pro 81.94、GPQA Diamond 75.44、SWE-bench Verified 51.56、IFBench 71.88、AA-LCR 52.00、Terminal-Bench 2.1 为 24.58,均为厂商口径。托管 API 的挂牌价大约在每百万输入 token 0.07 至 0.08 美元、输出 0.20 美元这一档,OpenRouter 已在 9 月 22 日发文解读它在 Agent 高频执行调用里的角色。

本地部署是它另一个卖点。第三方在 RTX 5090 上实测生成速度 334 令牌每秒、128k 文档的首个 token 14.9 秒;RTX 3090 上用 GGUF 量化跑到 193.7 令牌每秒,上下文从 32k 拉到 192k 时显存只多占 1119 MiB。混合架构在长上下文上的显存效率,是它能在消费级显卡上跑起来的关键。

核心功能

适合谁用

以下类型的用户会特别受益于 NVIDIA Nemotron 3.5 Lightning:

优点亮点

价格与方案

托管 API 挂牌价约每百万输入 token 0.07 至 0.08 美元、输出 0.20 美元,部分网关按免费额度提供。权重按 OpenMDW License Agreement v1.1 开放,可自行部署。具体价格以各家服务商公示为准。

总结与建议

Nemotron 3.5 Lightning 是 NVIDIA 开源权重的混合架构模型,30B 总参数、约 3B 激活,把 Mamba-2、注意力与混合专家层组合起来,预训练数据超 20 万亿 token,最长支持 1M 上下文并具备推理与工具调用能力,权重按 OpenMDW 许可开放。NVIDIA 让它与 550B 的 Nemotron 3 Ultra 分工,专门承接工具调用、编码这类高频执行步骤。托管 API 约每百万输入 token 0.07 至 0.08 美元,第三方消费级显卡实测生成速度达每秒数百 token,长上下文显存占用增幅很小。

版本演进

分类
AI 开发平台
价格
免费
标签
NVIDIA · MoE · Mamba