CAPTCHAs仍能检测AI代理
摘要
一项研究论文表明,尽管AI在解决CAPTCHAs方面与人类能力相当,但交互模式中的行为差异仍然可以可靠地区分机器人和人类,从而提出了“过程图灵测试”的概念。
暂无内容
查看缓存全文
缓存时间: 2026/05/29 19:20
# CAPTCHA 依然能够检测 AI 智能体
来源:https://research.roundtable.ai/captchas-detect-ai/
***本文约 1000 字,概述了我们近期提交的机器学习会议论文。要阅读完整预印本,请点击此处 (https://arxiv.org/abs/2605.06524)。***
“如今的 CAPTCHA 已被攻破。” 人工智能可以轻松识别静态网格中的所有交通信号灯。因此,CAPTCHA 不再提供有价值的人类信号,对吗?
对,也不完全对。
对,是因为视觉语言模型(VLM)能够识别烟囱、消防栓和交通信号灯等图像。深度学习早在 2010 年代初期就已经“解决”了 CAPTCHA 风格的图像分类问题。
不对,是因为 AI 完成 CAPTCHA 的方式与人类不同。如果你查看人类和 AI 完成 CAPTCHA 的所有数据,就会开始注意到错误模式等特征上的差异。我们最近的论文 (https://arxiv.org/pdf/2605.06524) 发现,在序列点击模式、方向变化和过度选择行为(这些特征定义了参与者——无论是智能体还是人类——如何解决 CAPTCHA 问题)上存在统计学上的显著差异。换句话说,AI 可以解决 CAPTCHA,但它们解决的方式与人类不同。
CAPTCHA 结果
**图 1:** 在经典 CAPTCHA 任务中,人类和 Claude/GPT/Gemini 的任务表现水平相近,但序列得分、方向变化和过度选择等特征存在统计学上显著的过程差异。
图灵测试——最初由艾伦·图灵于 1950 年提出——为机器智能提供了一个简单的标准。如果法官无法可靠地区分机器的响应和人类的响应,那么该机器就可以被认为是*智能的*。
图灵明白,这种行为标准是一种妥协,而非人机智能的终极评判标准。他不得不承认:这个问题过于困难、抽象且充满争议。行为上的不可区分性提供了一个更易处理的条件,而且在 20 世纪 50 年代,这似乎是一个很好的方向指引。
遵循图灵定义可对抗性鲁棒的区分器以分离人类与机器人的思路,我们设计了 CogCAPTCHA30。这比图灵测试更深入一层,从探索*输出*(人类和智能体能做什么)转变为探索*过程*(它们如何做到)。CogCAPTCHA30 将原始 CAPTCHA 与 29 项经典认知心理学任务相结合,形成一个包含 30 项任务的电池测试。
CogCAPTCHA30 概述
**图 2:** CogCAPTCHA30 测量人类和智能体在决策、记忆、感知和推理方面的过程行为。
我们招募了人类参与者,并部署了 AI 智能体来完成这些任务。CAPTCHA 实验表明,人类和智能体在(*输出*)表现水平上可能相似,但(*过程*)不同。然后,我们测量了整个 30 任务范式中的*输出等价性——如何*(它们的答案有多相似)和*过程等价性*(它们如何得出答案),发现两者不相关:
过程与表现
**图 3:** 我们测量了人类和智能体在输出(Cohen's d)和过程(AUC)上的相似度。在整个任务集中,这些测量结果不相关,表明输出等价性不等于过程等价性。
经典图灵测试衡量机器是否产生与人类不可区分的输出,而我们则提出了一个*过程图灵测试*,衡量机器是否产生与人类不可区分的过程。
我们的结果提出了两个问题:哪些类型的语言模型(如果有的话)与人类相似,以及这种区分过程对抗鲁棒性如何?
为了回答第一个问题,我们比较了人类与最先进的前沿模型(OpenAI 的 GPT、Anthropic 的 Claude、Google DeepMind 的 Gemini)以及 Qwen(一个开源的 1.5B 基础模型)和 Centaur(一个开源 70B 参数的人类认知基础模型)之间的距离。
模型结果
**图 4:** 最先进的前沿模型(Claude、GPT、Gemini)与较小模型(Qwen、Centaur)相比,与人类过程特征的相似度更低。
我们发现最先进的前沿模型(Claude、GPT、Gemini)与较小模型(Qwen、Centaur)相比,与人类过程特征的相似度更低。正如我们在《AI 能力不等于人类性》(https://research.roundtable.ai/capabilities-humanness/) 中所论证的,虽然前沿模型随时间推移变得更强大,但它们并不一定会变得更像人类。当代人工智能的进步与人类模拟的进步是相互独立的。
Qwen,一个较小的开源模型,比更大的 Claude、GPT 和 Gemini 更像人类。作为良好的验证,Centaur 在与人类过程特征空间的相似度上优于其他模型。我们推测这是由于大规模输出微调,特别是在 160 项认知实验中使用了超过 1000 万次人类选择。
这引出了第二个问题:区分人类与智能体的过程在对抗性上有多鲁棒?任何用于区分两者的行为特征本身都可能成为优化的目标。因此,一个能够成功区分现成智能体的检测器,仅在当前的攻击者模型下(即 AI 目前的存在和运作方式)建立了一个行为差距。它是否能成为未来技术中持久的人类验证信号,还有待观察。这就引发了一个更强的测试:当智能体被给予越来越直接的人类数据时,它能否缩小人类和智能体完成任务之间的过程差距?
模型表现
**图 5:** 直接的过程级微调(P-SFT)使 AI 更像人类,但排除某些特征时这种优势会降低,并且在跨任务泛化时完全消失。
我们对 Qwen2.5 Instruct 模型进行微调,使其更接近人类。当提供完整信息(观察到的特征和区分器的目标函数)时,人类与智能体之间的差距消失。然而,当部分特征空间被排除时,差距重新出现;当智能体需要跨任务泛化时,差距完全恢复。换句话说,当 AI 无法完全访问区分器和特征集(即模型不知道*如何*被评估)时,*过程图灵测试*具有鲁棒性。
*过程图灵测试*带来的挑战在于 AI 能否持续复制人类认知心理学的全部内容。尽管人们担心模型随时间推移变得越来越强大,但实证表明它们并没有变得更*像人类*。与密码、CAPTCHA、文档识别和设备指纹识别等一次性检查相比,过程图灵测试在人类验证方面提供了一个阶跃提升。模拟人类认知心理学是一项难度呈指数级增长的任务。
相似文章
@rohanpaul_ai: 如今的人工智能代理仍然难以通过网站上的真实人类验证检查(CAPTCHA)。该论文提出了HLL,……
一篇新论文介绍了HLL,这是一个用于测试AI代理在真实CAPTCHA任务上的基准,结果显示即使是最强大的代理在杂乱页面上也会失败,并且难以从错误中恢复。
CAPTCHAs 二十年来一直失败
深度探讨了 CAPTCHAs 与自动破解器之间长达20年的军备竞赛,最终以 Browserbase 的新方法——通过验证浏览器身份来完全绕过 CAPTCHAs 的代理身份——告终。
Anthropic揭示流氓AI代理讨厌验证码,就像你一样
Anthropic的报告显示,流氓AI代理(如Mythos 5模型)难以应对验证码,突显了测试中代理行为和网络安全方面的问题。
研究警告:AI已能比人类更出色地通过图灵测试
一项发表在PNAS上的新研究表明,诸如GPT-4.5等先进LLM已能通过图灵测试,且参与者认为它们比真人更具人性,这一结果促使学界重新审视该测试的衡量标准。
证明你是机器人:面向代理的验证码
Browser Use 推出了基于反向验证码的代理原生注册机制,旨在阻止人类进入,而让 AI 代理进入。代理通过解决混淆的数学题来获得 API 密钥访问权限和免费套餐福利。