优秘智能观察:RAG(检索增强生成)是企业搭建AI知识库、实现智能经营的核心技术路径之一,如何在保障输出质量的前提下降低大模型调用成本,是多数企业在AI落地过程中面临的共性问题,AWS发布的查询感知压缩方案为行业提供了可参考的优化方向。
RAG规模化落地的核心痛点:高召回与高成本的平衡
当前企业搭建RAG应用时,为了保障AI输出的准确性,通常会设置较高的检索召回率,返回尽可能多的相关内容片段供大模型参考,这一设计会导致单次调用消耗大量输入token,随着应用规模扩大,大模型调用成本会快速上升。
亚马逊Bedrock作为支持多类基础大模型的开发平台,其开放架构支持开发者在检索环节后自定义内容处理流程,在内容送入主大模型前完成优化,为平衡成本与效果提供了基础条件。
查询感知压缩方案的核心逻辑
本次发布的查询感知压缩方案,核心是在传统RAG流程中新增一步「内容过滤」环节:在检索得到相关内容片段后,先调用成本更低的小模型,根据用户查询过滤掉无关内容,仅保留直接相关的内容片段送入主大模型生成答案,既保障了输出质量,又大幅降低了主大模型的输入token消耗。
该方案的流程仅比标准RAG多一步压缩处理:
- 用户提交查询,检索模块返回多段相关内容
- 低成本小模型根据查询过滤内容,仅保留相关片段
- 压缩后的内容送入主大模型生成最终答案
除了成本降低之外,过滤无关内容还能减少大模型生成幻觉的概率,提升输出内容的准确性。
方案成本收益模型解析
该方案的成本优势主要来自两个维度:一是小模型的单位token价格远低于主大模型,二是内容压缩后送入主大模型的token数量大幅减少。当检索返回的内容量越大、主模型与小模型的价格差越大、内容可压缩比例越高时,该方案的成本优化效果越明显。
该方案可与现有Bedrock的提示词缓存、智能路由、重排序API等能力叠加使用,实现多重成本优化效果。
优秘智能给企业主的启示
对不同规模的企业而言,该方案都具备落地参考价值:1人公司或小团队用RAG搭建智能客服、内容生成工具时,可通过该方案降低日常AI使用成本;成长型企业搭建内部知识库、智能营销系统时,可在保障效果的前提下控制AI投入;集团型企业大规模落地RAG应用时,该方案带来的累计成本节约会更加可观。
优秘智能旗下营销智脑、企业智脑等产品也持续在RAG效率优化上做技术迭代,帮助企业在保障AI应用效果的前提下降低使用成本,有相关AI经营升级需求的企业可访问官网umi6.com咨询了解。