
微软Azure ND GB300 v6虚拟机刷新AI推理速度新纪录
微软Azure ND GB300 v6虚拟机在运行Meta的Llama2 70B模型时,实现了每秒110万个token的推理速度,刷新了AI推理领域的纪录。
11月5日,微软宣布其Azure ND GB300 v6虚拟机在运行Meta的Llama2 70B模型时,推理速度达到了每秒110万个token,刷新了AI推理领域的纪录。
微软首席执行官萨提亚・纳德拉(Satya Nadella)在X平台(原Twitter)上表示,这一成就得益于与英伟达的长期合作和其在生产级规模运行人工智能方面的专业能力。
Azure ND GB300 v6虚拟机由英伟达Blackwell Ultra GPU提供动力,基于NVIDIA GB300 NVL72系统。该系统在单个机架级配置中集成了72颗NVIDIA Blackwell Ultra GPU和36颗NVIDIA Grace CPU。
该虚拟机专门针对推理工作负载进行了优化,GPU内存容量提升了50%,热设计功耗(TDP)提高了16%。

微软在单个NVIDIA GB300 NVL72域内的18个ND GB300 v6虚拟机上,分别运行了MLPerf Inference v5.1基准测试中的Llama2 70B模型(采用FP4精度),并使用NVIDIA TensorRT-LLM作为推理引擎。
Signal65实验室副总裁拉斯・费洛斯(Russ Fellows)指出,这一里程碑不仅在于率先突破了每秒百万token的大关,更在于它是在一个专为满足现代企业动态使用需求和数据治理要求而设计的平台上实现的。
Signal65还补充道,与上一代NVIDIA GB200相比,Azure ND GB300在推理性能上提升了27%,而功耗仅增加了17%。
“与NVIDIA H100世代相比,GB300在机架级测试中实现了近10倍的推理性能提升,同时能效比提高了近2.5倍。”