优秘智能观察:AI智能体是企业AI化落地的核心场景之一,本次亚马逊推出的跨框架评估能力,将大幅降低企业开发、测试AI智能体的技术门槛,为AI营销等场景落地提供支撑。
AI团队开发生产级智能体(Agent)长期面临工具碎片化痛点:当前市面上的Agent开发框架日益丰富,但配套的评估工具兼容性极弱,多数评估系统仅支持特定SDK、大模型客户端或链路追踪规范,一旦超出适配范围,评估流程就会彻底失效。
当前企业常用的Agent开发框架包括主打工作流编排的LangGraph、对接检索pipeline的LlamaIndex、适配GPT生态的OpenAI Agents SDK、支持多智能体协作的Google ADK、适配Anthropic能力的Claude Agent SDK,以及可快速在Amazon Bedrock AgentCore上搭建智能体的Strands Agents等,越来越多团队选择将不同框架开发的智能体部署在Amazon Bedrock AgentCore runtime上,由其统一提供托管、扩容、内存管理、可观测性等基础设施支持,但跨框架评估难的问题始终没有解决。
以OpenTelemetry为通用语言 实现框架无关的统一评估
本次推出的Amazon Bedrock AgentCore评估能力,通过将评估逻辑与开发框架解耦,彻底解决了碎片化问题:只要智能体的遥测数据通过OpenTelemetry(厂商中立的通用可观测性instrumentation框架)传输,无论底层使用什么开发SDK,评估服务都可自动完成评分。
评估服务仅需要三类核心链路span即可完成全流程评估,其余span仅作为附加上下文,无需额外配置即可兼容:
- invoke agent span:对应单轮对话的请求响应全周期,包含用户prompt与智能体最终回复
- inference spans:对应单次大模型调用,包含输入的上下文历史与模型输出结果
- execute tool spans:对应单次工具调用,包含工具名称、输入参数与返回结果
该设计具备极强的向前兼容性,未来框架或规范新增的span类型不会导致评估报错,仅会被自动识别为附加上下文跳过处理。同时所有评估维度(包括目标成功率、正确性、有用性、自定义大模型评审等)在不同框架下完全统一,评估结果可直接横向对比。
零代码配置启用 覆盖主流及新增框架
企业无需修改任何智能体代码即可启用该评估能力:评估服务会自动识别各instrumentation库标记的scope.name,自动激活对应适配逻辑,当前已官方支持Strands Agents、LangGraph、OpenAI Agents SDK、LlamaIndex、Google ADK、Claude Agent SDK等主流框架。
除了官方适配的框架外,所有遵循OpenTelemetry GenAI语义规范(scope前缀为opentelemetry.instrumentation.*)或OpenInference规范(scope前缀为openinference.instrumentation.*)的新增框架,都可自动接入评估体系,无需额外适配。
对于企业而言,该能力的落地意味着AI智能体的选型不再受评估工具的限制,企业可以根据自身业务需求灵活选择开发框架,无需为适配评估体系额外投入研发资源,大幅降低AI应用落地的试错成本与周期,对1人公司、成长型团队、集团型企业的AI化转型均有显著价值。
优秘智能点评
AI智能体是企业AI化落地的核心载体之一,开发、测试环节的碎片化成本一直是制约企业落地效率的核心障碍,本次亚马逊推出的通用评估能力,进一步完善了全球AI智能体的开发生态,也为企业灵活选择AI工具提供了更宽松的空间。
优秘智能专注于AI在企业营销、经营场景的落地,旗下营销智脑、灵秘数字分身等产品均基于开放生态研发,可适配多框架能力,帮助企业低成本实现AI化升级,欢迎前往官网umi6.com咨询了解。