趋境科技联合摩尔线程落地国产PD异构推理方案 打造高性价比AI Token生产能力
趋境科技
项目背景
随着大模型应用进入规模化商业落地阶段,算力基础设施的竞争核心已经从单卡硬件性能转向系统级的Token生产效率,一套算力方案的商业价值核心衡量标准变为同等服务要求下的单位高品质AI Token生产成本。国产算力需要突破单卡性能的限制,形成系统层面的生产效率优势,完成从实验环境验证到规模化生产落地的跨越,才能满足各个行业大模型推理的算力需求,降低大模型应用的算力使用成本。 本案例依据「量子位」公开发布的信息整理,原文:https://www.qbitai.com/2026/09/484547.html
面临的痛点
大模型规模化商用落地后,传统的推理方案需要按照单阶段峰值算力需求配置整套基础设施,大模型推理的前置处理环节会占用大量高成本算力资源,直接推高了单位AI Token的生产成本。同时国产算力要落地到实际生产环境,需要应对高并发访问、超长上下文处理、流量持续波动等复杂业务场景,还要克服显存调度管理、多设备协同作业、服务运行稳定性等多重技术难点,此前多数国产异构推理方案仅能在实验环境完成验证,无法同时满足规模化生产对时延、吞吐量、稳定性、计算精度、长上下文处理能力的综合要求,难以支撑高品质AI Token的持续稳定输出。
优秘的方案
趋境科技联合摩尔线程打造推理前置处理与Token生成两个阶段分离的异构推理方案,由摩尔线程MTT S5000智算卡承接推理前置环节的输入计算和缓存生成工作,和负责后续Token生成任务的高带宽GPU搭配运行,降低前置处理环节对高成本算力资源的占用。趋境科技借助自研的国产PD异构技术完成模型深度适配优化和多设备协同调度,将不同类型的算力资源整合为统一稳定的端到端推理服务。双方还共同推出基于Token超节点(Token Pod)的软硬一体化生产解决方案,把模型适配、多设备协同、生产运营等方面的经验沉淀到Token Pod和ATaaS平台中,形成可复用、可弹性扩展、支持故障隔离的Token生产单元,能够根据不同业务需求灵活调整配置,支撑高品质AI Token的大规模生产。
实施路径
落地成效
想成为下一个成功案例?
预约专属顾问,结合你的行业与规模,给出可落地的 AI 化方案