英伟达GB200 NVL72服务器性能突破:Deepseek-R1等AI模型测试结果惊艳

英伟达GB200 NVL72服务器在混合专家模型上取得了显著性能提升,测试结果显示其性能比HGX 200提升10倍。本文将详细介绍该服务器的性能优化策略及其在AI计算领域的应用。

9效率工具英伟达AI服务器性能提升Deepseek-R1

科技媒体Wccftech近日报道,英伟达GB200 NVL72 AI服务器在“混合专家”模型上取得了重大性能突破。

该服务器基于开源大语言模型Kimi K2 Thinking、Deepseek-R1-0528、Mistral Large 3进行测试,结果显示其性能相比上一代Hopper HGX 200提升了10倍。

混合专家模型(MoE)是一种高效的AI大模型架构,它通过只激活与任务类型最相关的参数子集来解决问题,从而降低计算成本并提高处理速度。

Deepseek-R1 等 AI 模型测试:英伟达 GB200 NVL72 性能较 HGX 200 提升 10 倍插图

查看性能提升图解

为了解决MoE模型扩展时遇到的性能瓶颈,英伟达采用了“协同设计”策略,整合了GB200的72芯片配置、高达30TB的快速共享内存、第二代Transformer引擎以及第五代NVLink高速互联技术。

通过这些技术的协同工作,系统能够高效地将Token批次拆分并分配到各个GPU,同时以非线性速率提升通信量,从而将专家并行计算提升至全新水平。

英伟达还实施了多项全栈优化措施来提升MoE模型的推理性能,例如NVIDIA Dynamo框架通过将预填充和解码任务分配给不同的GPU,实现了任务的解耦服务。

Deepseek-R1 等 AI 模型测试:英伟达 GB200 NVL72 性能较 HGX 200 提升 10 倍插图1

查看NVFP4格式介绍

NVFP4格式在保持计算精度的同时,进一步提高了性能和效率,确保了整个AI计算流程的高效稳定。

此次GB200 NVL72取得的性能突破,对英伟达及其合作伙伴具有重要意义,成功克服了MoE模型在扩展时面临的计算瓶颈,巩固了英伟达在AI服务器市场的领先地位。