研究警告:AI已能比人类更出色地通过图灵测试
摘要
一项发表在PNAS上的新研究表明,诸如GPT-4.5等先进LLM已能通过图灵测试,且参与者认为它们比真人更具人性,这一结果促使学界重新审视该测试的衡量标准。
暂无内容
查看缓存全文
缓存时间: 2026/05/20 22:34
# 研究警告:AI终于能比人类更好地通过图灵测试
来源:https://www.the-independent.com/tech/ai-turing-test-artificial-intelligence-b2980452.html
一项研究发现,人工智能系统现在可以比人类更好地通过图灵测试。
图灵测试由先驱数学家创立,他称之为“模仿游戏”,是一项旨在检验机器能否展现与人类同等智能的实验。实验中,一名人类与看不见的参与者对话,并判断他们能否区分人类和人工智能。
现在,一项新研究声称首次严格地将现代大型语言模型用于测试。结果发现,人们认为这些模型比参与实验的真实人类更有人性。
该研究考察了四种不同的领先大型语言模型——包括驱动ChatGPT和Meta的LLaMa的最新模型——以及一些较老的系统。它们与真实人类进行了比较。
在研究中,最新的GPT-4.5被认为像人类的概率为73%,远高于真实人类。最新的LLaMa被认为像人类的概率为56%,几乎与它被比较的真实人类完全相同。
对较老模型的实验显示了这些系统的发展之快。2024年首次发布的GPT-4o被认为像人类的概率为21%,而20世纪60年代的ELIZA系统被认为像人类的概率为23%。
“我们发现,如果给予适当的提示词,先进的LLM可以展现出与人类相同的语气、直率、幽默和易错性,”该研究的通讯作者Cameron Jones表示。“虽然我们知道LLM可以轻松地生成几乎所有主题的知识,但这项测试表明,它们也能令人信服地展示社会行为特征,这对我们如何看待AI(https://www.the-independent.com/topic/ai)具有重大意义。”
研究人员建议,这项研究可能导致人们对图灵测试进行重新思考。
“图灵测试最初是作为一种询问机器能否与人类智能匹敌的方式,”加州大学圣迭戈分校认知科学教授、研究合著者Ben Bergen说。“但我们现在知道,AI能在许多问题上比人类更快、更准确地作答,所以真正的问题不在于原始脑力。”
“看到机器能够通过测试——以及它们如何通过测试——迫使我们重新思考这个测试的衡量标准。越来越明显,它在衡量的是‘类人性’。”
研究还显示了提示词在创建令人信服的聊天机器人中的重要性。研究人员表示,每个系统都被指示采用某种人格,或特定的角色和交流风格,这在一定程度上通过引导系统像人类一样犯错来实现。
如果没有这些提示词,模型更容易被识破。研究人员表明,在没有明确指令的情况下,GPT-4.5被认为像人类的概率仅为36%。
“它们有能力表现得像人类,但或许没有足够的能力去判断怎样才能表现得像人类。”Bergen教授说。
这项研究工作发表在最新论文《大型语言模型通过标准三方图灵测试》中,该论文刊登于《美国国家科学院院刊》(*Proceedings of the National Academy of Sciences*)。
相似文章
CAPTCHAs仍能检测AI代理
一项研究论文表明,尽管AI在解决CAPTCHAs方面与人类能力相当,但交互模式中的行为差异仍然可以可靠地区分机器人和人类,从而提出了“过程图灵测试”的概念。
GPT-4
OpenAI 发布 GPT-4,一个大型多模态模型,接受图像和文本输入,在专业和学术基准测试中表现出人类水平的性能,在各种评估指标上的表现明显优于 GPT-3.5。
新研究测试多款LLM与数千真实用户,发现AI无法模拟人类偏好
一项新研究在28项真实世界研究中测试了LLM,发现它们仅在53%的情况下与人类多数一致,与随机猜测无异,挑战了用LLM取代人类反馈的趋势。
Humanity's Last Exam 当前基准测试成绩思考?
讨论近期AI模型在'Humanity's Last Exam'基准测试中的得分,指出从2024年5月GPT-4o的2.7%提升至2026年6月左右45%,并对该考试的难度提出疑问。
配备工具后的GPT-5.5在BabyVision基准上已超越10岁儿童水平
GPT-5.5在配备工具后,在BabyVision基准测试中的表现已超越10岁儿童,标志着AI视觉推理能力的显著进步。