会懂网AI资讯获悉,英伟达宣布交互式AI推理加速器Groq 3 LPX正式全面量产。作为Vera Rubin平台的重要组成部分,Groq 3 LPX主打超低延迟Token生成,专为智能体AI等高响应场景设计,云服务商Nebius成为首个采用方。
在AgentX智能体工作负载、运行DeepSeek V4 Pro测试中,每兆瓦吞吐量最高达上一代GB300 NVL72的30倍,每Token成本最高降低35倍;Groq 3 LPX达到每秒3400个输出Token。
这标志着英伟达去年200亿美元收购Groq后获得的技术正式完成商业化落地。AI推理从”跑得动”进入”响应快”的新阶段,低延迟推理成为智能体AI规模落地的关键支撑。
业内分析认为,低延迟推理是Agent落地的前提。当AI智能体需要实时响应、持续交互时,推理延迟直接决定了用户体验。Groq 3 LPX的全面量产,为Agentic AI的大规模应用提供了算力保障。
从算力趋势看,AI推理正成为算力需求增长最快的环节。随着大模型训练边际放缓,推理优化成为竞争焦点。英伟达、AMD以及各大云厂商都在加速布局推理芯片,低延迟、高吞吐的推理能力将成为AI基础设施的新战场。
从技术演进看,Groq 3 LPX采用的LPU架构与传统的GPU架构不同,它针对大模型的顺序处理特性进行了专门优化,在推理延迟和能效比上具有天然优势。英伟达200亿美元收购Groq后,将这一技术整合进Vera Rubin平台,形成了训练用GPU加推理用LPU的完整算力组合,进一步巩固了其在AI算力生态的主导地位。






























暂无评论内容