@rohanpaul_ai: https://x.com/rohanpaul_ai/status/2061959891036885027
摘要
斯坦福法学院的一项研究发现,在对合同法课程简答题辅导的盲评中,法学院教授对大型语言模型生成的答案评分高于同伴答案,LLM在75.33%的比较中胜出,且较少被标记为有害。
查看缓存全文
缓存时间: 2026/06/03 23:56
法学教授更青睐AI而非同行答案 | 斯坦福法学院
来源:https://law.stanford.edu/publications/law-professors-prefer-ai-over-peer-answers/
摘要
大型语言模型(LLM)日益被推广为教育导师,然而大多数评估都聚焦于具有单一绝对基准的领域。但许多学科依赖于判断:推理、权衡歧义、并得出可辩护的结论。法学为此提供了一个严格的检验。我们与16位美国法学教授合作,对合同法课程中的短答辅导进行了盲审评估。参与者提出了40个代表性题目、撰写了答案,并对2918份匿名的人类与LLM回答进行了比较评判。教授们对LLM的评价远高于同行(平均胜率=75.33%),其表现与最佳教师相当。此外,LLM的回答极少被标记为有害(3.53%,而教授为12.06%)。对LLM答案的偏好在不同评估者间保持一致,并反映了共通的职业标准。通过使用另一个LLM作为评判者,我们的评估方法可可靠地扩展至更多模型,从而在判断密集型领域中提供一种高效且可扩展的AI导师评估方案。
相似文章
AI在斯坦福法学院研究中胜过法学教授
斯坦福法学院的一项研究发现,在盲评中,法学教授更喜欢AI生成的答案,而不是由同事教师撰写的答案,AI在直接对决中赢得了75%的胜率,这表明AI有潜力改变法律教育。
@rohanpaul_ai: LLM 常常无法判断攻击是否导致它们说出了不安全的内容。询问一个 LLM 它自己之前的回答是否……
本文研究了 LLM 是否能够可靠地自我报告其输出被对抗性预填充篡改的情况,发现模型通常无法区分被篡改的输出和故意的输出,其有限的识别能力源自正常的拒绝行为,而非真正的自我意识。
当没有参考答案时,LLM评委可能过于慷慨
本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。
区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。
当大语言模型过度回答:测量与缓解基于LLM的硬件描述语言问答中的质量问题
本文研究了LLM生成的硬件描述语言问答中的质量问题,发现过度回答倾向,如冗余(65.7%)和冗长(69.1%),并提出了一种多智能体框架,将核心答案减少37%,非核心内容长度减少31%,同时提高质量分数。