标签
本文介绍了S³-Bench,一个系统化的评估框架,用于评估语音交互模型作为科学语音助手,涵盖10个主要学科,并分析科学交互中的性能权衡。
SCICONVBENCH是一个基准测试,用于评估LLMs在跨计算科学领域中对表述不清的科学查询进行多轮澄清的能力。研究发现,即使是顶尖模型也难以进行消歧,并且频繁做出隐性假设。