研究警告:AI已能比人类更出色地通过图灵测试

Reddit r/ArtificialInteligence 论文

摘要

一项发表在PNAS上的新研究表明,诸如GPT-4.5等先进LLM已能通过图灵测试,且参与者认为它们比真人更具人性,这一结果促使学界重新审视该测试的衡量标准。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/20 22:34

# 研究警告:AI终于能比人类更好地通过图灵测试 来源:https://www.the-independent.com/tech/ai-turing-test-artificial-intelligence-b2980452.html 一项研究发现,人工智能系统现在可以比人类更好地通过图灵测试。 图灵测试由先驱数学家创立,他称之为“模仿游戏”,是一项旨在检验机器能否展现与人类同等智能的实验。实验中,一名人类与看不见的参与者对话,并判断他们能否区分人类和人工智能。 现在,一项新研究声称首次严格地将现代大型语言模型用于测试。结果发现,人们认为这些模型比参与实验的真实人类更有人性。 该研究考察了四种不同的领先大型语言模型——包括驱动ChatGPT和Meta的LLaMa的最新模型——以及一些较老的系统。它们与真实人类进行了比较。 在研究中,最新的GPT-4.5被认为像人类的概率为73%,远高于真实人类。最新的LLaMa被认为像人类的概率为56%,几乎与它被比较的真实人类完全相同。 对较老模型的实验显示了这些系统的发展之快。2024年首次发布的GPT-4o被认为像人类的概率为21%,而20世纪60年代的ELIZA系统被认为像人类的概率为23%。 “我们发现,如果给予适当的提示词,先进的LLM可以展现出与人类相同的语气、直率、幽默和易错性,”该研究的通讯作者Cameron Jones表示。“虽然我们知道LLM可以轻松地生成几乎所有主题的知识,但这项测试表明,它们也能令人信服地展示社会行为特征,这对我们如何看待AI(https://www.the-independent.com/topic/ai)具有重大意义。” 研究人员建议,这项研究可能导致人们对图灵测试进行重新思考。 “图灵测试最初是作为一种询问机器能否与人类智能匹敌的方式,”加州大学圣迭戈分校认知科学教授、研究合著者Ben Bergen说。“但我们现在知道,AI能在许多问题上比人类更快、更准确地作答,所以真正的问题不在于原始脑力。” “看到机器能够通过测试——以及它们如何通过测试——迫使我们重新思考这个测试的衡量标准。越来越明显,它在衡量的是‘类人性’。” 研究还显示了提示词在创建令人信服的聊天机器人中的重要性。研究人员表示,每个系统都被指示采用某种人格,或特定的角色和交流风格,这在一定程度上通过引导系统像人类一样犯错来实现。 如果没有这些提示词,模型更容易被识破。研究人员表明,在没有明确指令的情况下,GPT-4.5被认为像人类的概率仅为36%。 “它们有能力表现得像人类,但或许没有足够的能力去判断怎样才能表现得像人类。”Bergen教授说。 这项研究工作发表在最新论文《大型语言模型通过标准三方图灵测试》中,该论文刊登于《美国国家科学院院刊》(*Proceedings of the National Academy of Sciences*)。

相似文章

CAPTCHAs仍能检测AI代理

Hacker News Top

一项研究论文表明,尽管AI在解决CAPTCHAs方面与人类能力相当,但交互模式中的行为差异仍然可以可靠地区分机器人和人类,从而提出了“过程图灵测试”的概念。

GPT-4

OpenAI Blog

OpenAI 发布 GPT-4,一个大型多模态模型,接受图像和文本输入,在专业和学术基准测试中表现出人类水平的性能,在各种评估指标上的表现明显优于 GPT-3.5。