response-evaluation

标签

Cards List
#response-evaluation

音频语言模型是否使用副语言证据?用于响应评估的反事实审计

arXiv cs.CL ↗ · 2026-08-10 缓存

引入了反事实审计,以测试音频语言模型评委在评估语音到语音响应时是否真正使用副语言证据,结果发现对比性成功往往高估了原生可靠性,而相似的准确率可能掩盖Gemini、GPT和开放模型之间不同的失败模式。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈