英伟达据报重启“Rubin CPX”AI加速器项目 改用168GB HBM4内存

📅 2026-09-01

摘要:

据供应链分析师郭明錤透露,英伟达此前一度搁置的“Rubin CPX”AI加速器项目如今重新启动,并对内存架构进行了重新设计。该产品原计划搭载128GB GDDR7显存,如今改为配备168GB HBM4高带宽内存。

英伟达在去年年底曾宣布,计划基于Rubin GPU家族开发一款专用加速器,主要面向大规模智能体人工智能工作负载。项目公布后曾被报道暂时搁置,但英伟达目前似乎已经完成重新规划。Rubin CPX将部署在独立机架中,每个机架可配置64至256块独立CPX GPU。

与负责解码任务的常规Rubin GPU不同,CPX GPU主要用于大语言模型推理过程中的“预填充”阶段,负责处理输入上下文以及KV缓存。英伟达正在尝试将预填充和解码任务分离,由CPX GPU承担预填充工作,再由常规Rubin GPU负责解码,从而提升整体推理效率。

一个配备8块CPX GPU的机架托盘,可处理容量达1.34TB的长上下文预填充数据及相关KV缓存,并全部依靠HBM4内存完成。HBM4能够提供更高的内存带宽,有助于加快长上下文数据的处理速度。由于此前的设计并不需要集成HBM4,英伟达也必须重新设计芯片封装,预计可能采用台积电的CoWoS-S或CoWoS-L先进封装技术。

在计算性能方面,Rubin CPX采用单片式芯片设计,可提供30千兆次浮点运算,即30 PFLOPS的NVFP4计算性能。芯片内部还集成了4个NVENC视频编码引擎和4个NVDEC视频解码引擎,使其无需依赖外部处理器即可完成更高效的多媒体相关工作负载。

随着大语言模型的参数规模迈向万亿级别,将预填充任务与解码任务分别交由不同机架处理,有望显著提升令牌生成和交付速度。英伟达还建议,在负责解码的机架中,CPX GPU与常规Rubin GPU维持1比1的配置比例。

关联标签

相似文章

评论

0/500
验证码(点击图片刷新)
暂无评论