标签
VoxMem是一个用于评估大型音频语言模型中多模态记忆的基准测试,重点考察声学证据类型和多会话记忆操作。它揭示了当前模型中的显著差距,例如与语义内容相比,说话者身份和副语言线索的保留较差。
本文探讨了大型语言模型是否为二语英语学习者提供基于证据的发音反馈,发现LLMs往往依赖刻板印象和先验知识而非声学证据,导致反馈虽连贯但不准确。