行业资讯

arXiv新研究:全双工语音AI隐式指令遵循能力仍存落地挑战

🎧 本文 AI 播客

优秘智能观察:近期arXiv平台发布的语音AI技术研究成果,填补了全双工语音系统隐式行为评估的行业空白,为企业布局智能语音交互场景、评估AI助手适配性提供了新的参考维度。

研究核心:填补全双工语音AI隐式行为评估空白

全双工语音代理是支持实时对话、可灵活处理插话、接话、打断等复杂交互场景的AI系统,目前已广泛应用于智能客服、数字人交互、办公助手等企业场景。对企业而言,这类产品早已不是前沿概念,但不少企业在落地时都遇到过类似痛点:预设了温柔耐心的客服人设,AI却经常打断客户发言;给出了直播带货的角色要求,AI遇到观众插话提问时不会灵活接话,始终按预设话术走完流程,最终导致用户体验差、转化效率低。

此前行业对全双工语音系统的评估多基于显性指令测试,无法还原真实场景中AI需要从角色人设、业务规则中推导交互行为的需求。本次发布的DuplexSpeechBench-IFEval(DSB-IFEval)评估体系,包含1038个测试用例,覆盖8类常见AI助手角色,可从五个维度评估系统的指令遵循能力:默认行为、显性行为指令、人设隐含行为、人设+规则组合条件、指令冲突场景,同时推出了可量化的指令遵循得分(IAS)和人设一致性得分(PAS)两大评估标准。

核心发现:不同语音系统能力各有短板

研究团队对6款主流实时语音系统进行测试后,得出了三个对企业选型有直接参考价值的结论:

  • 专用全双工模型对指令显性度敏感度更高:据本次研究的测试数据显示,仅给出人设要求、无明确行为规则时,F-Actor、PersonaPlex等模型的指令遵循度分别下降9.7%、4.5%;
  • 通用实时语音模型人设内容匹配度高,但交互时机灵活性不足:GPT-Realtime、MiniCPM-o等产品的人设一致性表现较好,但无法根据人设灵活调整插话、接话的时机,主动交互能力受限;
  • 所有测试系统在冲突场景下的调整能力仍有缺陷:即使系统可以遵循冲突指令匹配人设,遇到安全类冲突时,仍难以灵活调整预设的人设要求。

这些测试结果也对应了企业落地中的常见问题:如果客服场景选用通用实时语音模型,很可能出现客户插话时AI不停顿、始终说完预设话术的情况,拉低客户满意度;如果选用专用全双工模型却只给人设、没有明确的交互规则,又容易出现表现不稳定的问题。

优秘智能给企业主的启示

对于计划布局智能语音交互场景的企业,选型时不要仅关注基础对话准确率,可结合自身业务场景增加针对性测试:比如客服场景需重点测试插话应对、情绪安抚等隐含行为的适配性,营销数字人场景需验证人设一致性与灵活交互的平衡,内部办公助手场景则要重点测试冲突指令的处理优先级。

针对不同规模的企业,选型时的侧重也可有所区分:1人公司、小团队使用语音AI主要用于数字人口播内容生产、基础客户咨询响应,可重点测试人设一致性表现,确保输出内容与品牌定位匹配即可;成长型企业布局智能客服、销售语音跟进等直面客户的场景时,需同时验证人设匹配度与交互灵活性,优先选择支持自定义交互规则、可适配插话/打断等复杂场景的产品;集团型企业做私有化部署的全域语音交互系统时,需额外增加冲突场景测试,确保业务规则与安全规则出现冲突时,系统可优先遵循合规要求响应。

优秘智能聚焦AI在企业营销、运营场景的落地,旗下产品均基于灵枢网关统一底座提供稳定的AI交互能力:灵秘·数字分身支持1:1克隆真人形象与声音,可自定义人设与交互规则,批量生成符合品牌定位的口播短视频;营销智脑覆盖营销全链路,其中的智能语音交互模块适配客服、销售跟进等多场景的复杂交互需求,可灵活配置插话响应、情绪适配等隐含行为规则。有AI落地需求的企业可前往官网umi6.com咨询,获取专属适配方案。

读完这篇,下一步可以这样落地

把文章里的方法,拆成你的企业 AI 化方案

留下联系方式,顾问会结合你的行业、团队规模和当前业务目标,给你一份更具体的落地建议。

先做 AI 测评
结合行业场景输出落地路径信息严格保密
内容不是终点

让顾问帮你判断,哪些 AI 场景值得先做

一次沟通即可梳理当前业务里最容易产生回报的 AI 应用入口。

先做 AI 测评
结合行业场景输出落地路径信息严格保密