英伟达Groq机架量产,每秒输出3400 Token

英伟达以200亿美元收购Groq所获得的技术,正式进入商业化阶段。当地时间8月24日,英伟达高级总监Dion Harris宣布,Groq 3 LPX机架已全面量产。

Groq 3 LPX是英伟达今年3月为Vera Rubin平台研发的推理加速器,主打超低延迟Token生成。英伟达称,在Artificial Analysis测试中,搭载Gemma 4 31B模型、10万Token上下文时,Groq 3 LPX实现每秒3400个输出Token,为该模型创下最高纪录;针对智能体编程等低延迟工作负载,其响应速度最高达到最近竞争平台的4倍。Groq架构在芯片裸片上集成了500兆字节高速静态随机存储器(SRAM),用于减少与内存相关的延迟。

英伟达押注Groq,核心指向低延迟推理。

Harris的说法是,低延迟推理能让AI智能体更快响应,避免用户长时间等待,在编程等应用场景中尤其重要。商业回报上,云服务商可以针对这类Token收取更高费用。Harris在电话会议中表示:“对于提供Token输出服务的厂商而言,该产品让他们可以面向对延迟极度敏感的客户,推出高端增值服务套餐。”

去年12月,英伟达斥资200亿美元收购Groq资产,这是公司有史以来规模最大的一笔收购。Groq创始人Jonathan Ross随后加入英伟达,担任首席软件架构师。Groq机架将与Vera中央处理器和Rubin图形处理器一同部署在新型云服务商Nebius的数据中心,预计今年晚些时候上线。Groq芯片由三星代工,英伟达GPU则由台积电制造。

英伟达同时公布Vera Rubin NVL72在真实智能体工作负载下的测试结果:基于SemiAnalysis的AgentX工作负载、采用DeepSeek V4 Pro模型,Vera Rubin每兆瓦吞吐量最高达到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。

市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。

关键词阅读:科技财经资讯风格

责任编辑:栎树
AI智能分析该文,为您挖掘投资机会该AI功能处于试用阶段,内容仅供参考,请仔细甄别!
展开
精彩推荐
加载更多
全部评论
热榜
关闭 下载金融界app
金融界App
金融界微博
金融界公众号