标签
引入了反事实审计,以测试音频语言模型评委在评估语音到语音响应时是否真正使用副语言证据,结果发现对比性成功往往高估了原生可靠性,而相似的准确率可能掩盖Gemini、GPT和开放模型之间不同的失败模式。