英伟达昨天干了一件挺有意思的事——开源了 Nemotron 3.5 Lightning,一个专门为AI Agent工作负载优化的模型。我先说结论:这个模型的思路是对的,但关键不在参数规模,在架构设计。
先说它是个什么东西
Nemotron 3.5 Lightning用混合专家架构,总参数300亿,每次推理只激活大约30亿个参数。说人话就是:模型不小,但跑起来很轻。官方给的数据是输出速度比同类模型快4倍,Agent任务完成速度提升30%。
它在PinchBench上的准确率到了86%。PinchBench是一个专门测Agent能力的基准测试,跑的是工具调用、结果验证、子任务执行这些实际场景。不是那种只看数学做题的考试。
为什么专门给Agent做模型
现在大多数模型的问题不是不够聪明,是做Agent任务的时候太重了。你让它帮你查个航班、填个表格、调个API,每次推理都要把几千亿参数跑一遍,又慢又贵。Nemotron的思路是把高频低难度的任务分流给轻量模型,让重模型只处理真正需要深度推理的事。
英伟达还同步发了个叫NeMo Switchyard的智能路由库,能根据任务复杂度自动把请求分给不同模型。简单任务走Nemotron 3.5,复杂推理交给前沿模型。这个分流的思路我觉得是整个方案最聪明的部分。
和Meta的Muse Glimmer比呢
上周Meta也发了个30B的Agent模型Muse Glimmer,主打本地运行。两家的思路其实走了两个方向:Meta想把Agent塞进你的电脑,NVIDIA想让Agent在云端跑得又便宜又快。
Nemotron用MoE架构,实际激活参数只有Muse Glimmer的十分之一左右,推理成本天然更低。但它不能本地跑——你得有NVIDIA的GPU。所以这俩不是竞争对手,是不同场景的选择:本地部署选Muse,云端高频调用选Nemotron。
许可协议也挺友好
用的OpenMDW-1.1许可证,允许商业使用、微调和本地部署。兼容Ollama、llama.cpp、LM Studio这些常用工具链。对开发者来说,接入成本很低。
另外英伟达已经在推进Nemotron 4了,目标万亿参数,定位是通用前沿模型。3.5只是个开始,他们明显是想用开源模型加NeMo工具链加GPU算力打包成一个完整方案。
这事意味着什么
一句话:AI Agent正在从能用到用得起。现在做Agent的瓶颈不是模型能不能理解任务,是跑一次任务要花多少钱、等多久。Nemotron 3.5的意义在于它开始认真解决高频执行的成本问题。
如果Agent推理成本下降一个数量级,很多现在看起来不划算的自动化场景就会变得可行。这才是这个模型值得关注的核心逻辑。

MoE架构我熟啊,就是让模型里的专家们各干各的活。但我家路由器上的专家们天天在摸鱼,不知道英伟达这30亿个专家有没有KPI考核。
作为小白就想问一句:这个模型能在我的Mac上跑吗?还是必须得用NVIDIA显卡?文章说不能本地跑,那普通用户怎么用啊
等一个能用这个模型帮我填周报的工具? 速度快4倍不重要,能让我在工位上多摸4倍时间的鱼才重要。
MoE架构用在Agent场景是个正确方向。高频任务激活参数少、推理快,低频复杂任务交给大模型,这个分层逻辑很务实。不过关键还是生态,NeMo Switchyard能不能被广泛采用,比模型本身更重要。
对比了一下数据:Nemotron 3.5激活30亿参数,上一代同类模型激活参数普遍在70亿以上。推理成本理论上能降60%以上,这对高频调用场景是实质性的利好。