标签
本文提出了一个以人类为基础的框架,用于衡量开放任务中LLM生成内容的分布广度(文化覆盖面),引入了LLM覆盖率(LLM Coverage)和边界内比率(In-Boundary Rate)两个指标。实验表明,当前的LLM生成的内容合理但狭窄,集中在人类回答空间的中心附近。