@rohanpaul_ai: https://x.com/rohanpaul_ai/status/2061959891036885027

X AI KOLs Following 论文

摘要

斯坦福法学院的一项研究发现,在对合同法课程简答题辅导的盲评中,法学院教授对大型语言模型生成的答案评分高于同伴答案,LLM在75.33%的比较中胜出,且较少被标记为有害。

https://t.co/6XOcRz9fZ7
查看原文
查看缓存全文

缓存时间: 2026/06/03 23:56

法学教授更青睐AI而非同行答案 | 斯坦福法学院

来源:https://law.stanford.edu/publications/law-professors-prefer-ai-over-peer-answers/

摘要

大型语言模型(LLM)日益被推广为教育导师,然而大多数评估都聚焦于具有单一绝对基准的领域。但许多学科依赖于判断:推理、权衡歧义、并得出可辩护的结论。法学为此提供了一个严格的检验。我们与16位美国法学教授合作,对合同法课程中的短答辅导进行了盲审评估。参与者提出了40个代表性题目、撰写了答案,并对2918份匿名的人类与LLM回答进行了比较评判。教授们对LLM的评价远高于同行(平均胜率=75.33%),其表现与最佳教师相当。此外,LLM的回答极少被标记为有害(3.53%,而教授为12.06%)。对LLM答案的偏好在不同评估者间保持一致,并反映了共通的职业标准。通过使用另一个LLM作为评判者,我们的评估方法可可靠地扩展至更多模型,从而在判断密集型领域中提供一种高效且可扩展的AI导师评估方案。

相似文章

AI在斯坦福法学院研究中胜过法学教授

Hacker News Top

斯坦福法学院的一项研究发现,在盲评中,法学教授更喜欢AI生成的答案,而不是由同事教师撰写的答案,AI在直接对决中赢得了75%的胜率,这表明AI有潜力改变法律教育。

当没有参考答案时,LLM评委可能过于慷慨

arXiv cs.CL

本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。