8月12日消息,当地时间8月11日,英伟达宣布为DGX与RTX系统推出一系列重大AI更新。

Meta开源的Muse Glimmer模型(300亿参数稠密架构)针对英伟达平台深度优化,在RTX 5090上推理速度超过每秒200个token。同时发布的NeMo Switchyard开源模型路由库可将智能体任务成本降低67%。

黄仁勋终于出招了!RTX 5090跑200 token/秒:成本大降67%

在模型和路由工具之外,英伟达同期还推出了另一款主打极致效率的开源模型Nemotron 3.5 Lightning。这是一款300亿参数的MoE开源模型,官方宣称其token生成速度是同类模型的4倍,智能体任务完成时间缩短30%。

该模型采用开放权重,支持开发者使用自有数据进行微调,可直接在RTX PC、DGX Spark、DGX Station及Jetson平台上本地运行。

NeMo Switchyard是此次发布的另一重磅工具。这个开源路由库可根据任务复杂度、成本和延迟,为智能体工作流的每一步动态选择最优模型。

英伟达内部测试显示,在保持前沿水平准确性的情况下,任务成本可降至单独使用Opus 4.8的近三分之一。LangChain报告称跨145个多轮Deep Agent任务实现74%成本降低。

在视频生成领域,LTX 2.5开源视频模型新增多镜头生成与生成式编辑功能。在英伟达RTX GPU、DGX Spark和DGX Station上,该模型实现2倍性能提升和40%显存节省。RTX 5090在Wan-Animate-2模型上较苹果M3 Ultra带来最高26倍性能优势。

黄仁勋终于出招了!RTX 5090跑200 token/秒:成本大降67%

DGX Spark平台同步获得多项增强。Sync Cluster Assistant支持将多台DGX Spark组成高速集群。此外,Sync Resource Monitor可提供跨单系统或整个集群的CPU与GPU实时及历史视图。

目前,英伟达RTX平台已全面支持Cosmos 3 Edge、MiniMax-H3、DeepSeek V4-Flash等多款开源模型。

黄仁勋终于出招了!RTX 5090跑200 token/秒:成本大降67%

【本文来源:快•科技】