@panickssery: 除了识别LLM的使用外,Pangram还发现许多学者不知道假阳性和假阴性之间的区别…
摘要
Pangram,一个用于检测LLM使用的工具,揭示了许多学者不理解假阳性和假阴性之间的区别。
除了识别LLM的使用外,Pangram还发现许多学者不知道假阳性和假阴性之间的区别。
相似文章
@rohanpaul_ai: LLMs 会根据语气、确定性和语法形式的不同,以不同方式接受相同的虚假主张。措辞的微小变化…
本文介绍了 EoBench,这是一个基准测试,用于测试 LLMs 对以 19 种不同风格表述的虚假主张的接受程度,发现语气、确定性和语法形式显著影响模型响应,而更大的模型和经过指令调优的模型显示出更强的抵抗力。
区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。
@rohanpaul_ai: LLM 常常无法判断攻击是否导致它们说出了不安全的内容。询问一个 LLM 它自己之前的回答是否……
本文研究了 LLM 是否能够可靠地自我报告其输出被对抗性预填充篡改的情况,发现模型通常无法区分被篡改的输出和故意的输出,其有限的识别能力源自正常的拒绝行为,而非真正的自我意识。
不仅仅是X,更是Y
本文探讨了LLM的后训练(RLHF和RLVR)如何产生诸如否定平行结构之类的语言特征,并批评了使用AI检测工具(Grammarly、Pangram)的做法,这些工具迫使写作者为了避免被误判而模仿机器语言。
@omarsar0:LLM评审的怪异现象确实存在。避免对LLM评审使用评分,或如果使用需极其谨慎。尽可能使用二分类标签……
一条推文讨论了一个发现的怪现象:将论文PDF重命名为更长、更积极的标题会提高LLM评审的评分,建议谨慎使用基于评分的LLM评估,并推荐改用二分类标签。