会懂网AI资讯获悉,9月4日,有消息称英伟达重启了面向推理场景的Rubin CPX GPU,规格调整为168GB HBM4显存,预填充(prefill)性能获得提升,预计2027年一季度投入生产。对以长上下文、高并发推理为核心负载的数据中心而言,这是一次指向明确的规格调整。

推理与训练对硬件的要求正在分化。训练追求极致的峰值算力与互联带宽,而推理更看重大容量显存、单位功耗吞吐与成本。CPX这样的“推理专用”产品线,本质上是把长上下文场景中最贵的那部分资源——显存容量——优先堆上去,让单卡能装下更大的模型与更长的KV缓存。
预填充性能的强化同样有现实背景。在Agent与长文档场景里,用户一次性输入的上下文越来越长,首字延迟很大程度由预填充阶段决定。把这一环节做快,体验上的改善比峰值算力更直观。
时间点的选择也值得玩味。随着模型厂商把价格战打到每百万Token不足1美元,推理成本成为生死线;谁能用更少的卡、更低的功耗跑同样的负载,谁就能在报价单上占据主动。这正是推理专用卡的价值所在。
对采购方而言,这类推理专用卡的出现也改变了算账方式。过去评估一片GPU看的是峰值算力与单价,如今更要看单卡能装下多大的模型、每个Token的电耗是多少。当评估指标从“每秒多少次运算”变成“每美元产出多少Token”,硬件选型的结论往往会完全不同。
会懂网判断,AI芯片的竞争正从“一颗通用芯片打天下”走向“按负载分层”。训练卡、推理卡、端侧芯片各自演化,再由软件栈把它们编排成一套系统。Rubin CPX的重启说明英伟达也在跟随这一分层趋势——当客户的账单由推理决定,产品定义就必须由推理倒推。






















暂无评论内容