标签
本文研究了在学术论文推荐中作为对话搜索引擎使用的LLMs中的权威偏见,发现LLMs对基于作者声誉和引用等权威信号的论文表现出显著偏好,而去偏措施仅部分有效。
本文通过受控的医学问答设置研究LLM中的权威偏见,揭示模型以与感知权威成比例的分级方式覆盖正确答案。该效应局限于一个关键的后层,其中正确答案表征被主动擦除。