标签
本文提出一个框架,用于评估LLM在科学查询中生成不同语言复杂度的多个响应的能力。研究发现,模型常常不一致地变化复杂度,表现最好的Claude Sonnet 4.5仅能在46%的情况下正确调整复杂度。