微软Phi-4-mini-flash-reasoning模型发布:端侧AI推理效率大幅提升

微软最新发布的Phi-4-mini-flash-reasoning模型,在端侧AI推理方面表现出色,尤其在数学和逻辑推理能力上得到显著增强,适用于资源受限的设备。

9效率工具AI模型端侧推理效率提升微软技术

Phi-4-mini-flash-reasoning模型介绍

微软近日推出了Phi-4-mini-flash-reasoning小语言模型,旨在提升端侧AI模型的数学和逻辑推理能力。

微软发布 Phi-4-mini-flash-reasoning 端侧 AI 模型:10 倍吞吐量,推理能力升级插图

该模型适用于边缘设备、移动应用和嵌入式系统等资源有限的环境,能够引入先进的推理功能。

微软发布 Phi-4-mini-flash-reasoning 端侧 AI 模型:10 倍吞吐量,推理能力升级插图1

架构创新

Phi-4-mini-flash-reasoning采用了SambaY架构,其中Gated Memory Unit(GMU)组件能够高效地在模型内部共享信息,提升模型效率。

微软发布 Phi-4-mini-flash-reasoning 端侧 AI 模型:10 倍吞吐量,推理能力升级插图2

微软发布 Phi-4-mini-flash-reasoning 端侧 AI 模型:10 倍吞吐量,推理能力升级插图3

性能提升

相比其他Phi模型,Phi-4-mini-flash-reasoning的吞吐量最高提升10倍,处理请求或生成文本的能力大幅增强,延迟降低至其他Phi模型的1/2~1/3。

微软发布 Phi-4-mini-flash-reasoning 端侧 AI 模型:10 倍吞吐量,推理能力升级插图4

应用场景

Phi-4-mini-flash-reasoning模型已在Azure AI Foundry、NVIDIA API Catalog和Hugging Face上线,适用于多种实际应用场景。