@freemanjiangg: 我很高兴分享我在 Sesame 上的工作成果!https://turnbench.sesame.com 是我们的轮流发言基准…

X AI KOLs Following 论文

摘要

Sesame 发布了 TurnBench,这是一个用于评估实时对话轮流发言的基准测试,包含排行榜和标注数据集,以评估模型在检测语音事件方面的性能。

我很高兴分享我在 Sesame 上的部分工作成果! https://t.co/fupLcRfcsE 是我们用于实时对话的轮流发言基准测试:何时发言以及何时让话 https://t.co/iHe4G8JHP4
查看原文
查看缓存全文

缓存时间: 2026/08/29 01:47

我非常高兴分享在Sesame的一些工作成果!

https://t.co/fupLcRfcsE 是我们针对实时对话的轮次交接基准测试:何时发言、何时让步 https://t.co/iHe4G8JHP4


TurnBench

来源:https://turnbench.sesame.com/ 一个多领域对话轮次交接评估基准。我们在双声道人类对话中手工标注了“轮次结束“和“打断“事件,并衡量模型检测这些事件的准确率和速度。

说话人1说话人2轮中停顿轮次结束打断反馈信号时间 →轮中停顿轮次结束打断反馈信号时间 →

排行榜

理想的模型应在保持低误报率和低延迟的同时实现高召回率。以下模型基于我们的留出测试集进行评估,并按召回率排序。

排名模型召回率↑误报率↓延迟↓ 1Voice Activity Projection0.8450.055368毫秒 2ESPnet轮次交接0.8260.078862毫秒 3WavLM大型锚点模型0.8000.0541076毫秒 4Mimi端点检测器0.7820.078645毫秒 5Kyutai语义VAD0.7730.0591007毫秒 6智能轮次v30.7520.0471017毫秒 7ESPnet轮次交接(每声道)0.7110.081730毫秒 8Gemini 3.1实时版0.6570.0221234毫秒 9WavLM大型因果模型0.4080.054683毫秒 10WavLM基础因果模型0.4030.061701毫秒 11OpenAI实时(语义VAD)0.3030.018793毫秒 12Moshi0.2330.044702毫秒 13OpenAI实时(服务器VAD)0.9550.525282毫秒 14RMS能量VAD0.7180.632-117毫秒

召回率:检测到的真实事件比例(越高越好)。误报率:测试集中的误报率(越低越好);超过0.15则视为不合格。延迟:事件发生后的中位延迟时间(p50毫秒,越低越好)。点击任意模型可查看完整报告:包含每个对话的开发集得分,以及其在查看器中的预测叠加结果。

数据集

TurnBench基于30小时录音室录制的双声道双人语音语料库评估模型。该语料库由Mundo AI (https://mundoai.world/) 提供,包含154段对话、106名演员,并在6种对话类型间保持均衡[1] (https://turnbench.sesame.com/#fn-1)。每段对话由三名独立标注员进行标注(Fleiss’s κ = 0.78),真实标签取2/3共识结果。

此外,我们提供了otoSpeech训练数据集,其标注协议与评估集完全相同。所有三个数据集划分均可在Hugging Face上获取。

训练集104小时otoSpeech (https://huggingface.co/datasets/otoearth/otoSpeech-full-duplex-turn-104h) 由Oto采集并标注开发集7.3小时轮次基准开发集 (https://huggingface.co/datasets/mundo-ai/turn-benchmark-dev) 由Mundo AI采集并标注测试集22.9小时轮次基准测试集 (https://huggingface.co/datasets/mundo-ai/turn-benchmark-test) 由Mundo AI采集仅含音频我们为公开开发集创建了交互式数据查看器 (https://turnbench.sesame.com/conversations/42)。该音频播放器可显示每个对话的波形图,并叠加标注标签。您可以将这些标签与已发布基线的预测结果进行比较,或提交您自己的预测。

评估方法

TurnBench要求模型针对以下事件输出离散的时间点列表[2] (https://turnbench.sesame.com/#fn-2):

轮次结束指说话人发言完毕,交出话语权供另一方接替。误报:在轮中停顿时宣布轮次结束。打断指一方在另一方仍在说话时夺取话语权。误报:因反馈信号、噪声、声道串扰或回声而错误宣布发生打断。我们在GitHub (https://github.com/SesameAILabs/turnbench) 上开源了评分器、提交格式和基线实现。

实验结果

我们发现“轮次结束“的召回率与对话类型无关[1] (https://turnbench.sesame.com/#fn-1),而“打断“的误报率则不同,往往集中在反馈信号密集的随意对话中。正如预期,声学检测器会对静音过度敏感,在达到召回率饱和的同时突破了误报率预算。而语义系统则更具选择性但速度较慢,通过等待更多证据来控制误报率。

VAP模型在轮次结束和打断两项任务中均表现最强,但目前尚无系统能同时满足高速度、高召回率和低误报率的要求。参考数据显示,TurnBench语料库中的人类平均在轮次结束之前151毫秒即开始轮次交接[3] (https://turnbench.sesame.com/#fn-3)。我们希望TurnBench能成为社区构建更高效语音交互系统的宝贵资源。

参与提交

我们邀请社区在此基础上改进成果,并提供开发集评分器 (https://turnbench.sesame.com/dev) 作为资源。如需提交成果,请通过电子邮件[email protected]提供:

  1. 排行榜显示的模型名称
  2. 机构名称
  3. predictions-dev.jsonpredictions-test.json文件

完整提交说明请参见:提交格式说明 (https://github.com/SesameAILabs/turnbench/blob/main/docs/SUBMISSION_FORMAT.md)

合作者

相似文章

Hy-MultiTurn:面向深度多轮对话理解的六维基准

arXiv cs.CL

介绍了 Hy-MultiTurn,一个用于深度多轮对话理解的中文基准,评估了 22 个前沿模型,涵盖六种受控模式(约束记忆、精确执行、约束合成、对象定位、动作抑制、指代消解),共 209 个任务,对话轮次从 12 轮到 76 轮不等。即使是最强的模型 GPT-5.5,也仅能满足 41.1% 的响应要求。