2026 年 8 月 24 日,英伟达正式宣布面向 AI 推理的 Groq 3 LPX 机架进入全面量产阶段。该产品专为 Vera Rubin 平台设计,与 Vera Rubin NVL72 GPU 主机架搭配部署,构成训练推理一体化的异构计算架构。
英伟达公布的测试数据显示,在 SemiAnalysis AgentX 智能体工作负载下运行 DeepSeek V4 Pro 模型时,Vera Rubin NVL72 每兆瓦吞吐量最高达到上一代 GB300 NVL72 的 30 倍,每 Token 成本最高降低 35 倍。Groq 3 LPX 在搭载 Gemma 4 31B 模型、10 万 Token 上下文的测试中,实现每秒 3400 个输出 Token,针对智能体编程等低延迟场景的响应速度最高达到最近竞争平台的 4 倍。
值得关注的是,SpaceXAI 将采用 Vera CPU 加速下一代智能体应用,并随着算力向数 GW 扩张建设 Vera Rubin 基础设施。SpaceXAI 还计划将优化版 Vera Rubin NVL72 用于首代 Starmind AI 卫星,将 AI 计算平台从地面数据中心延伸至轨道环境。
英伟达此次将 Groq 3 LPX 推向全面生产,核心并非用专用推理芯片取代 GPU,而是为 Vera Rubin 补充低延迟 Token 生成能力。智能体任务不同于传统一问一答,需要读取文件、调用工具、执行代码并循环数百乃至数千步骤,每一步的 Token 生成速度直接影响整体任务完成时间。
【AICOR 点评】英伟达正在从卖芯片升级为定义智能体时代的算力经济学。每 Token 成本 35 倍的降幅不是渐进改良,而是量级跃迁——当推理成本降至如此低位,企业大规模部署 AI Agent 的经济门槛将被实质性打破。这对 AICOR 推动的人机协同组织落地是重大利好:算力成本的断崖式下降,意味着更多企业有能力将 AI 员工从概念验证推向全量上岗。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。