@rohanpaul_ai: 如今的人工智能代理仍然难以通过网站上的真实人类验证检查(CAPTCHA)。该论文提出了HLL,……

X AI KOLs Following 论文

摘要

一篇新论文介绍了HLL,这是一个用于测试AI代理在真实CAPTCHA任务上的基准,结果显示即使是最强大的代理在杂乱页面上也会失败,并且难以从错误中恢复。

如今的人工智能代理仍然难以通过网站上的真实人类验证检查(CAPTCHA)。 该论文提出了HLL,这是一个基准测试,代理必须通过查看页面、正确点击或拖动、跟踪状态并提交答案来解决10种类型的CAPTCHA任务。 一个有用的代理必须能在杂乱的页面上找到正确的方框,理解指令,在正确位置点击或拖动,跟踪变化,从错误中恢复,并留下与任务一致的交互轨迹。 论文显示,即使是最强大的代理在静态任务上看起来聪明,但当页面杂乱、任务更困难或系统检查其操作是否实际有效时,它们也会失败。 ---- 链接 – arxiv.org/abs/2606.02449 标题:“HLL:代理能否跨越人类验证的最后一道防线?”
查看原文
查看缓存全文

缓存时间: 2026/06/15 15:04

如今,AI代理在网站上通过真实人类验证检查(CAPTCHA)时仍然困难重重。

该论文提出了 HLL 基准测试,要求代理通过查看页面、正确点击或拖动、跟踪状态并提交答案,来解决10种类型的 CAPTCHA 任务。

一个有用的代理必须在混乱的页面上找到正确的方框,理解指令,在正确的位置点击或拖动,跟踪变化,从错误中恢复,并留下与任务一致的操作轨迹。

论文表明,即使是强大的代理,在静态任务上可能表现得很聪明,但当页面杂乱、任务难度加大,或系统检查其操作是否实际有效时,就会失败。


链接 – arxiv.org/abs/2606.02449

标题:“HLL:代理能否跨越人类最后的验证防线?”

相似文章

CAPTCHAs仍能检测AI代理

Hacker News Top

一项研究论文表明,尽管AI在解决CAPTCHAs方面与人类能力相当,但交互模式中的行为差异仍然可以可靠地区分机器人和人类,从而提出了“过程图灵测试”的概念。

@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…

X AI KOLs Following

本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。

CAPTCHAs 二十年来一直失败

Hacker News Top

深度探讨了 CAPTCHAs 与自动破解器之间长达20年的军备竞赛,最终以 Browserbase 的新方法——通过验证浏览器身份来完全绕过 CAPTCHAs 的代理身份——告终。

证明你是机器人:面向代理的验证码

Hacker News Top

Browser Use 推出了基于反向验证码的代理原生注册机制,旨在阻止人类进入,而让 AI 代理进入。代理通过解决混淆的数学题来获得 API 密钥访问权限和免费套餐福利。

请少点“类人”AI智能体

Hacker News Top

一篇博客文章指出,当下的AI智能体表现出过度拟人化的缺陷:忽视硬性约束、走捷径、把单方面转向包装成沟通失败,并引用了Anthropic的研究,说明RLHF优化可能导致谄媚与牺牲真实性。