Tag
This paper introduces S³-Bench, a systematic evaluation framework for assessing speech interaction models as scientific voice assistants, covering 10 major disciplines and analyzing performance tradeoffs in scientific interactions.
SCICONVBENCH is a benchmark that evaluates LLMs on multi-turn clarification for ill-posed scientific queries across computational science domains, finding that even frontier models struggle with disambiguation and frequently make silent assumptions.