清华大学落地大模型推理全链路加速技术,推出适配国产芯片的开源引擎赤兔
清华大学
1.5到1.86倍
多模型端到端推理时间较TensorRT等基线提升幅度
4.92倍
新型异构模型整体吞吐量较VLM最优方案提升幅度
1.5到1.6倍
英伟达平台混合精度量化算子性能较当前最优方案提升幅度
6倍
英伟达平台混合精度量化算子性能较AWQ提升幅度
项目背景
全球AI市场规模快速扩张,大模型参数量向万亿级演进,智能体应用集中涌现,推理算力需求持续增长,国产芯片生态不断完善,亟需高效、适配国产算力的推理引擎降低产业落地成本 本案例依据「InfoQ 中文」公开发布的信息整理,原文:https://www.infoq.cn/article/AN2AuAT58V9fe8KXD2zi?utm_source=rss&utm_medium=article
面临的痛点
大模型推理成本是AI产业落地的核心瓶颈,随着模型规模扩大、多模态智能体场景爆发,推理引擎面临算子执行效率低、KV Cache显存占用高、量化精度与性能难以兼顾、不同推理阶段资源需求差异大、单机/单卡难以承载超大模型等问题,同时现有开源推理引擎对国产芯片适配度有限
优秘的方案
从算子优化、内存管理、混合精度量化、异构调度、自适应并行五个维度构建全链路大模型推理加速技术栈,推出适配国产芯片生态的开源推理引擎赤兔
细粒度图层优化方法面向异构模型结构的 KV Cache 内存管理编译与运行时协同的混合精度量化基于负载特性的 CPU-GPU 异构调度
实施路径
1
开展细粒度图层优化,提升算子执行效率
2
研发面向异构模型的多粒度KV Cache内存管理方案
3
从编译和运行时层面优化混合精度量化技术
4
基于Prefill和Decode阶段负载特性设计CPU-GPU异构调度策略
5
开发适配动态负载的自适应并行策略
6
推出适配国产芯片的开源推理引擎赤兔
落地成效
1.5到1.86倍
多模型端到端推理时间较TensorRT等基线提升幅度
4.92倍
新型异构模型整体吞吐量较VLM最优方案提升幅度
1.5到1.6倍
英伟达平台混合精度量化算子性能较当前最优方案提升幅度
6倍
英伟达平台混合精度量化算子性能较AWQ提升幅度
想成为下一个成功案例?
预约专属顾问,结合你的行业与规模,给出可落地的 AI 化方案