scientific-assistant

标签

Cards List
#scientific-assistant

S³-Bench: 评估语音交互模型作为科学语音助手

arXiv cs.CL · 23小时前 缓存

本文介绍了S³-Bench,一个系统化的评估框架,用于评估语音交互模型作为科学语音助手,涵盖10个主要学科,并分析科学交互中的性能权衡。

0 人收藏 0 人点赞
#scientific-assistant

SCICONVBENCH:在计算科学任务制定中基准测试LLMs的多轮澄清能力

Hugging Face Daily Papers · 2026-05-18 缓存

SCICONVBENCH是一个基准测试,用于评估LLMs在跨计算科学领域中对表述不清的科学查询进行多轮澄清的能力。研究发现,即使是顶尖模型也难以进行消歧,并且频繁做出隐性假设。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈