行业资讯

RAG成本优化新方案:亚马逊Bedrock推出查询感知压缩能力

🎧 本文 AI 播客

优秘智能观察:RAG(检索增强生成)是企业搭建AI知识库、实现智能经营的核心技术路径之一,如何在保障输出质量的前提下降低大模型调用成本,是多数企业在AI落地过程中面临的共性问题,AWS发布的查询感知压缩方案为行业提供了可参考的优化方向。

RAG规模化落地的核心痛点:高召回与高成本的平衡

当前企业搭建RAG应用时,为了保障AI输出的准确性,通常会设置较高的检索召回率,返回尽可能多的相关内容片段供大模型参考,这一设计会导致单次调用消耗大量输入token,随着应用规模扩大,大模型调用成本会快速上升。

亚马逊Bedrock作为支持多类基础大模型的开发平台,其开放架构支持开发者在检索环节后自定义内容处理流程,在内容送入主大模型前完成优化,为平衡成本与效果提供了基础条件。

查询感知压缩方案的核心逻辑

本次发布的查询感知压缩方案,核心是在传统RAG流程中新增一步「内容过滤」环节:在检索得到相关内容片段后,先调用成本更低的小模型,根据用户查询过滤掉无关内容,仅保留直接相关的内容片段送入主大模型生成答案,既保障了输出质量,又大幅降低了主大模型的输入token消耗。

该方案的流程仅比标准RAG多一步压缩处理:

  • 用户提交查询,检索模块返回多段相关内容
  • 低成本小模型根据查询过滤内容,仅保留相关片段
  • 压缩后的内容送入主大模型生成最终答案

除了成本降低之外,过滤无关内容还能减少大模型生成幻觉的概率,提升输出内容的准确性。

方案成本收益模型解析

该方案的成本优势主要来自两个维度:一是小模型的单位token价格远低于主大模型,二是内容压缩后送入主大模型的token数量大幅减少。当检索返回的内容量越大、主模型与小模型的价格差越大、内容可压缩比例越高时,该方案的成本优化效果越明显。

该方案可与现有Bedrock的提示词缓存、智能路由、重排序API等能力叠加使用,实现多重成本优化效果。

优秘智能给企业主的启示

对不同规模的企业而言,该方案都具备落地参考价值:1人公司或小团队用RAG搭建智能客服、内容生成工具时,可通过该方案降低日常AI使用成本;成长型企业搭建内部知识库、智能营销系统时,可在保障效果的前提下控制AI投入;集团型企业大规模落地RAG应用时,该方案带来的累计成本节约会更加可观。

优秘智能旗下营销智脑、企业智脑等产品也持续在RAG效率优化上做技术迭代,帮助企业在保障AI应用效果的前提下降低使用成本,有相关AI经营升级需求的企业可访问官网umi6.com咨询了解。

读完这篇,下一步可以这样落地

把文章里的方法,拆成你的企业 AI 化方案

留下联系方式,顾问会结合你的行业、团队规模和当前业务目标,给你一份更具体的落地建议。

先做 AI 测评
结合行业场景输出落地路径信息严格保密
内容不是终点

让顾问帮你判断,哪些 AI 场景值得先做

一次沟通即可梳理当前业务里最容易产生回报的 AI 应用入口。

先做 AI 测评
结合行业场景输出落地路径信息严格保密