MozillaOcho是浏览器公司的创新和实验小组,其有趣的创新之一是Llamafile,这是一种从单个文件分发和运行人工智能大型语言模型(LLM)的简便方法。今天晚上发布的Llamafile0.8.2是最新版本,更新了Llama.cpp,最令人兴奋的是对AVX2性能进行了优化。
访问:
Llamafile的目标是让用户和开发人员更容易获得人工智能LLM,它支持从单个文件精简部署大型语言模型,这些模型既能在CPU和GPU上执行,也能跨平台运行。Llamafile已经支持利用AVX/AVX2实现更快的性能,并支持AVX-512以实现更快的速度。在今天发布的Llamafile0.8.2中,又增加了AVX2优化功能。
Llamafile0.8.2发布说明中提到
在过去几年中,英特尔和AMD处理器广泛支持高级矢量扩展2(AdvancedVectorExtensions2):大多数英特尔CPU从Haswell开始支持高级矢量扩展2,而AMD方面则从ExcavatorCPU开始支持高级矢量扩展2。
拉取请求指出,在更快的AVX2提示处理方面取得了一些令人振奋的成果。据报告,各种计算器具的速度都提高了1.4至2.3倍。
大量参与Llamafile开发工作的JustineTunney最初回应了拉取请求:
对于Llamafile0.8.2而言,这些针对提示处理的AVX2优化已经足够令人兴奋了。不过,0.8.2版还带来了内存错误修复、文本生成的轻微性能优化、本周的Llama.cpp代码更新以及各种新标志。
有关Llamafile0.8.2版的下载和更多详情,请访问GitHub。针对新版本的新Llamafile基准测试即将发布。