标签
本研究评估了六种专有大型语言模型(LLMs)在16种DSM-5病症中通过对抗性攻击的表现,发现安全防护措施仅对自杀和自伤可靠,而对进食障碍、物质使用障碍等其他病症的失败率高达100%。
作者认为,从专有AI模型转向开放模型现在几乎不再是一种职业牺牲,理由是开放模型质量的提升以及Claude的ID验证作为催化剂,类似于历史上从Windows到Linux的转变。
像DeepSWE这样的新基准测试揭示了专有与开源AI模型之间的显著性能差距,令开源社区感到失望。
Miles Brundage 评论说,关于蒸馏如何影响开源权重与专有AI模型之间的能力差距,目前缺乏定量分析,并引用了Epoch AI的说法,即开源权重模型落后四个月。