智谱 GLM-5.1 高速版震撼发布,速度突破400 tokens/s,引领AI工具新潮流

智谱最新推出的GLM-5.1高速版API,以高达400 tokens/s的输出速度刷新全球纪录,打破传统“快即轻量”定律,为AI工具领域带来革命性突破。

34效率工具AI工具智谱GLM-5.1速度突破效率提升

智谱GLM-5.1高速版API发布

5月22日,智谱正式推出面向企业客户的GLM-5.1高速版API——“GLM-5.1-highspeed”。该模型以400 tokens/s的输出速度,刷新了当前全球大模型API的速度上限。

打破“快即轻量”定律

在以往的行业认知中,“快”往往意味着参数量的妥协,高速模型几乎等同于轻量级模型。而GLM-5.1高速版彻底打破了这一惯例,首次在国产大模型中,将旗舰级的智能表现与极低延迟同时带入了生产环境。

打破“快即轻量”定律!智谱 GLM-5.1 高速版发布,400 tokens/s 刷新全球纪录插图

技术突破与优化

  • 推理引擎层:针对GLM-5.1架构重写核心推理路径,大幅提升单卡吞吐;
  • 调度系统层:利用动态批处理、请求合并与KV缓存调度,有效降低高并发下的尾延迟;
  • 基础设施层:对集群部署、网络链路与负载均衡协同优化,确保400 TPS不仅是瞬时峰值,更是稳定可用的生产级能力。

TileRT技术助力

在底层技术逻辑上,TileRT抛弃了Runtime层的动态调度,采用编译期(AOT)静态编排,将整个计算图化作常驻GPU的Persistent Engine Kernel。单卡内,算子间中间结果经由Register、Shared Memory与L2 Cache直传,告别写回Global Memory的延迟;多卡间,则将Warp Specialization思路扩展至8卡NVL拓扑,让不同GPU化身特化worker,而非执行同构逻辑。

应用场景广泛

目前,GLM-5.1高速版已面向智谱MaaS平台部分企业客户开放,可广泛应用于AI编程、实时交互、商业决策及实时语音等对延迟极度敏感的场景。