DeepSeek宣布开源DeepGEMM 连续三天宣布开源三大重要库 在开源周活动中,DeepSeek大放异彩,连续三天宣布开源三大重要库,为人工智能领域注入新的活力。
DeepSeek在开源周的第三天宣布开源DeepGEMM。FP8通用矩阵乘法是专门为简洁高效而设计的。(GEMM)具有粗粒度缩放功能的设计库。它支持一般和混合专家。(MoE)采用CUDA编写分组GEMM。使用轻量级即时编译,无需编译。(JIT)在运行过程中,模块、DeepGEMM可以编译所有核心,支持V3/R1的实践和推理。
在此之前的一天,DeepSeek正式宣布开源DeepEP,这是第一个用于MoE模型训练和推理的开源EP通信库。DeepEP支持NVLink和RDMA,其特点是高效、完善的全员沟通,可以在节点和节点之间实现高性能通信。与此同时,它还具有高吞吐核心和低延迟核心,原生支持FP8调度,并能灵活控制GPU资源,实现计算与通信的重叠。DeepSeek宣布开源DeepGEMM 连续三天宣布开源三大重要库
在开源周的第一天,DeepSeek开始了FlashMLA的第一个代码库开源。在此之前,DeepSeek还宣布将组建一个小团队来探索AGI(通用人工智能),并计划开源5个代码库,以透明的方式共享研究进展。
DeepSeek 开源周的第三天,带来了专门的开源周 Hopper 架构 GPU 矩阵乘法库的优化— DeepGEMM。本库支持标准矩阵计算和混合专家模型(MoE)计算,为 DeepSeek-V3/R1 在实践和推理方面有很强的支持, Hopper 达到GPU 1350 FP8 TFLOPS 的高性能。
DeepGEMM 设计理念简洁高效,核心代码仅约 300 好吧,同时,在大多数矩阵尺寸下,性能优于目前的解决方案。该库支持三种数据排列方式:标准排列和两种独特的排列(连续排列和掩码排列),专为混合专家模型设计。DeepGEMM 选择即时编译技术,安装时无需编译,代码结构清晰易懂,特别适合学习。 GPU 优化技术。DeepSeek宣布开源DeepGEMM 连续三天宣布开源三大重要库
DeepGEMM 在各种计算场景中表现出色。对标准矩阵乘法而言, CUTLASS 3.6 与优化实现相比,速度提升 1.0 到 2.7 倍数不等。小批量数据处理(M=64 或 128)得到了最显著的加速,最高达到 2.7 倍。
计算混合专家模型,DeepGEMM 两种特殊的数据排列方法也有明显的优势。持续排列适用于练习和批量推理阶段,速度提升约为 1.1 到 1.2 两倍;专为即时推理设计的掩码排列方式,支持与支持 CUDA 图形技术的使用,同样可以加速。 1.1 到 1.2 倍。DeepSeek宣布开源DeepGEMM 连续三天宣布开源三大重要库DeepSeek宣布开源DeepGEMM 连续三天宣布开源三大重要库
什么叫 FP8 和 GEMM?
计算机中,数值需要存储在二进制位中,存储方式决定了精度和所需空间。传统上,AI 计算使用 32 位置浮点(FP32),它提供了高精度,但是它占用了更多的存储空间和计算资源。
研究发现,很多AI 事实上,任务不需要这么高的精度。16 位置浮点(FP16)已经被广泛使用, 8 位置浮点(FP8)是进一步降低精度的。虽然 FP8 精确度低,但是对许多AI 任务足够,可以大大减少内存的使用,提高处理速度。就像用粗刻度测量大物体一样。虽然精度降低了,但是速度快了很多,在很多情况下已经足够准确了。
GEMM(通用矩阵乘法)是深度学习中最基本、最常见的计算操作。简单来说,它计算了两个数据表(矩阵)乘积的结果。这看似简单,但在AI中在计算中,这些矩阵可能非常大,含有数百万个元素,这使得矩阵乘法成为整个系统中最耗时的部分之一。大多数神经传输层的计算本质上包括矩阵乘法。
DeepGEMM 专门改善了 FP8 精确矩阵乘法,同时解决 Hopper 架构在处理 FP8 精确度问题可能发生在计算过程中,确保数值准确可靠。
猜你喜欢
独身女子病逝房产收归国家 生前未订立遗嘱
特朗普推出500万美元移民金卡 美国将取消EB-5投资签证项目
奥运冠军全红婵拟保送暨南大学 职业运动员要获取怎样的成绩才能保送大学

