韩国科学技术院(KAIST)的一家初创公司Panmnesia推出了一种尖端IP,可通过PCIe上的CXL协议为人工智能GPU添加外部存储器,从而打破了存储器容量的障碍,提供有效的基础设施来解决HBM的局限性。
目前的人工智能加速器仅限于板载内存,而制造商只能提供非常有限的HBM。随着数据集的不断增长和对功耗的需求,业界正专注于增加更多的人工智能GPU,而考虑到其所占用的财务和制造资源,这种方法从长远来看是不可持续的。有鉴于此,由韩国KAIST研究所支持的公司Panmnesia推出了一个CXLIP,可以让GPU利用DRAM甚至SSD的内存,扩展内置的HBM。
为了实现连接,CXL采用了PCIe链接,确保在消费者中得到广泛采用。不过,这也有一个问题。传统的人工智能加速器缺乏必要的子系统,无法直接连接并利用CXL进行内存扩展,而且UVM(统一虚拟内存)等解决方案的速度相当慢,这就失去了初衷。
不过,作为一种解决方案,Panmnesia开发出了自己的符合CXL3.1标准的RootComplex芯片,它有多个端口,通过PCIe总线连接GPU和外部内存,HDM(主机管理设备内存)解码器则充当连接的桥梁,管理内存分配和转换。
有趣的是,Panmnesia决定将他们的解决方案(CXL-Opt)与三星和Meta开发的原型产品(他们称之为"CXL-Proto")进行基准测试。令我们惊讶的是,CXL-Opt的往返延迟(即数据从GPU传输到内存再返回所需的时间)大大降低。CXL-Opt的延迟时间为两位数纳秒,而CXL-Proto的延迟时间为250ns。除此之外,CXL-Opt的执行时间远远少于UVM解决方案,因为它的IPC性能速度是UVM的3.22倍。
Panmnesia的解决方案可以在市场上取得巨大进步,因为它是堆叠HBM芯片和实现更高效解决方案之间的中介。鉴于该公司是首批拥有创新CXLIP的公司之一,如果这一技术获得认可,Panmnesia将受益匪浅。