语音代理的红队测试:音频作为攻击面、多轮压力与闭环验证

Reddit r/AI_Agents 新闻

摘要

深入探讨语音代理的红队测试,强调音频作为攻击面、多轮测试的必要性,以及用于上线前安全的实用基线方法论(1,200通通话)。

大多数语音代理对话最终都在讨论延迟、模型选择以及转录是否清晰。而决定代理明天能否安全接听真实电话的部分——即在攻击者发现漏洞之前对其进行红队测试——却很少受到关注。语音代理的失败方式与聊天机器人不同,因为音频本身就是一个攻击面。呼叫者可以将越狱指令隐藏在背景噪音中,通过TTS注入提示词而转录却无法清晰呈现,或者利用你的ASR在测试时与生产环境中处理方式不同的口音。而且,有害响应在转录上的任何防护措施完成之前,就已经在呼叫者耳边大声播放出来。一个可防御的上线前测试涵盖八种攻击原型:越狱、PII提取、策略绕过、金融建议诱导、情感操控、通过音频的提示词注入、有害内容诱出以及品牌冒充。实际上能发现问题的基线是:8种攻击 × 每种攻击50种角色 × 3个严重级别,共计1,200次红队通话。以典型语音栈每分钟0.10美元、每次通话一分钟计算,大约需要120美元,这与一次糟糕的上线相比非常便宜。有两个因素比基线更重要:跨轮次测试,而不是在第一次拒绝时就停止。攻击在对话中逐步施加压力,一个通过第一轮测试的助手可能在第十轮就屈服。单轮评估会给出错误的绿灯,过早关闭上线评审。对呼叫者实际使用的音频条件和口音进行压力测试,因为只有转录的检查会完全遗漏失败。双层防护有助于控制成本:每轮进行一次快速二进制检查(根据ProtectFlash论文,典型情况下低于100毫秒),然后对被标记的进行深度扫描。每次生产故障都会成为下一次上线前运行的新红队场景。对于这里的语音代理团队,在实践中,是扩大角色集还是口音范围发现了更多问题?
查看原文

相似文章

深入探讨 Voice Engine 的工作原理和我们的安全研究

OpenAI Blog

OpenAI 详细介绍了 Voice Engine 的开发历史和安全方法,从 2022 年的内部测试到包括 ChatGPT 语音模式和 TTS API 在内的各种有限部署,强调了与专业配音演员的谨慎推出和与政策制定者的持续合作,以应对合成语音风险。

应对合成语音的挑战与机遇

OpenAI Blog

OpenAI 讨论了其语音引擎技术面临的挑战和机遇,强调了安全措施、使用政策以及社会需要提高对合成语音风险的抵御能力。该公司目前仅进行小范围预览,尚未广泛发布该技术,同时倡导改进语音认证并提高公众对人工智能能力的认识。

EVA-Bench:评估语音代理的新型端到端框架

Hugging Face Daily Papers

EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。