AI算力服务(大模型推理)集团企业

趋境科技联合摩尔线程落地国产PD异构推理方案 打造高性价比AI Token生产能力

趋境科技

4至5台
Prefill资源池所需MTT S5000配置数量(输入Token处理性价比超国际先进算力方案)
超过50 TPS
Token平均生成速度
超90%
KV Cache命中率
99.9%
服务稳定性

项目背景

随着大模型应用进入规模化商业落地阶段,算力基础设施的竞争核心已经从单卡硬件性能转向系统级的Token生产效率,一套算力方案的商业价值核心衡量标准变为同等服务要求下的单位高品质AI Token生产成本。国产算力需要突破单卡性能的限制,形成系统层面的生产效率优势,完成从实验环境验证到规模化生产落地的跨越,才能满足各个行业大模型推理的算力需求,降低大模型应用的算力使用成本。 本案例依据「量子位」公开发布的信息整理,原文:https://www.qbitai.com/2026/09/484547.html

面临的痛点

大模型规模化商用落地后,传统的推理方案需要按照单阶段峰值算力需求配置整套基础设施,大模型推理的前置处理环节会占用大量高成本算力资源,直接推高了单位AI Token的生产成本。同时国产算力要落地到实际生产环境,需要应对高并发访问、超长上下文处理、流量持续波动等复杂业务场景,还要克服显存调度管理、多设备协同作业、服务运行稳定性等多重技术难点,此前多数国产异构推理方案仅能在实验环境完成验证,无法同时满足规模化生产对时延、吞吐量、稳定性、计算精度、长上下文处理能力的综合要求,难以支撑高品质AI Token的持续稳定输出。

优秘的方案

趋境科技联合摩尔线程打造推理前置处理与Token生成两个阶段分离的异构推理方案,由摩尔线程MTT S5000智算卡承接推理前置环节的输入计算和缓存生成工作,和负责后续Token生成任务的高带宽GPU搭配运行,降低前置处理环节对高成本算力资源的占用。趋境科技借助自研的国产PD异构技术完成模型深度适配优化和多设备协同调度,将不同类型的算力资源整合为统一稳定的端到端推理服务。双方还共同推出基于Token超节点(Token Pod)的软硬一体化生产解决方案,把模型适配、多设备协同、生产运营等方面的经验沉淀到Token Pod和ATaaS平台中,形成可复用、可弹性扩展、支持故障隔离的Token生产单元,能够根据不同业务需求灵活调整配置,支撑高品质AI Token的大规模生产。

国产PD异构技术高密度AI算力原生FP8精度

实施路径

1
与摩尔线程达成战略合作,深度融合自研国产PD异构技术与摩尔线程MTT S5000智算卡、MUSA软件平台技术能力
2
采用推理前置处理与Token生成两阶段分离的异构推理架构,由MTT S5000承接前置环节的输入计算与缓存生成工作,搭配高带宽GPU运行降低高成本算力资源消耗
3
借助自研国产PD异构技术完成模型深度优化和多设备协同调度,整合不同类型算力资源,输出统一稳定的端到端推理服务
4
针对国产头部大模型复杂业务场景开展多轮性能迭代和专项优化,以真实线上流量检验优化效果,持续迭代模型配置和服务策略
5
共同推出基于Token Pod的软硬一体化Token生产解决方案,将模型适配、多设备协同、生产运营经验沉淀至Token Pod和ATaaS平台,形成可复用的生产能力
6
推进国产化高品质AI Token工厂建设,拓展联合方案在互联网企业、基础模型公司、运营商等行业的落地应用

落地成效

4至5台
Prefill资源池所需MTT S5000配置数量(输入Token处理性价比超国际先进算力方案)
超过50 TPS
Token平均生成速度
超90%
KV Cache命中率
99.9%
服务稳定性

想成为下一个成功案例?

预约专属顾问,结合你的行业与规模,给出可落地的 AI 化方案