检测 AI 智能体需要什么?浏览器自动化下行为检测的最小特征集

arXiv cs.AI 论文

摘要

这篇 arXiv 论文提出了一种三分类检测框架,用于区分人类、机器人和 AI 智能体,并表明二元分类器会系统性地错误分类智能体。它确定了最小特征集(例如 mouse_event_rate 和 teleport_click_ratio),这些特征集在各种规避级别下都能实现完美的智能体召回率。

arXiv:2607.26935v1 公告类型:新 摘要:大规模部署的机器人检测器将流量视为二元类别:人类或机器人。当 AI 智能体通过浏览器自动化浏览网页时,这一假设不再成立——这是一种既非人类也非机器人的流量类别,而二元分类器在结构上无法表示它。我们提出了一种三分类检测框架,用于区分人类、机器人和 AI 智能体,并表明二元分类器与智能体之间的混淆是架构性的:二元的人类-机器人检测器会错误路由智能体会话,因为其标签空间缺少智能体类别。在我们的受控基准测试中,MLP 二元分类器将 39.1% 的真实 AI 智能体误分类为人类,SAINT 二元 transformer 则误分类了 34.5%;添加一个显式的智能体类别后,在全部 30 次运行(3 个模型族 $\times$ 10 个随机种子)中,智能体类别的 F1 值均达到 1.000。为了衡量抗规避能力,我们构建了一个五级规避阶梯,涵盖被动观察、GAN 生成的轨迹以及真实人类光标数据的重放($n = 2299$ 个规避会话)。在 10 个随机种子和 3 个模型族中,我们在 22990 次逐种子预测中观察到零次智能体漏检。这种判别性信号是浏览器自动化的产物,而非智能体推理的证据:Playwright 不会发出物理输入设备所生成的原始指针移动和滚轮增量流,而这种缺失特征在轨迹操纵后依然存在。对所有大小为 1-5 的特征子集(9401 个 GBM)进行穷举搜索表明,两个行为特征(mouse_event_rate、teleport_click_ratio)在每一个规避级别下都能实现 100% 的观测智能体召回率,智能体精确率为 0.994;五个特征可将 macro-F1 提升至 0.991。该信号是冗余编码的:移除 teleport_click_ratio 后,智能体检测仍保持在 100%。单特征机制是退化的,它只能通过将分类器坍缩为始终预测“智能体”来标记每个智能体。两个特征就能稳健地分离出智能体;五个特征可在 macro-F1 $\geq 0.99$ 的水平上区分全部三种流量类别。
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:01

# 检测AI智能体需要什么?浏览器自动化下行为检测的最小特征集 来源:https://arxiv.org/html/2607.26935 ###### 摘要。大规模部署的机器人检测器将流量视为二元的:人类或机器人。在AI智能体通过浏览器自动化浏览网页的世界里,这一假设被打破——该类流量既非前者也非后者,而二元分类器在结构上无法表示它。我们提出了一个三类检测框架,能够正确区分人类、机器人和AI智能体,并表明“二元vs智能体”的混淆是架构性的:二元的“人类vs机器人”检测器会错误路由智能体会话,因为标签空间缺少智能体类别。在我们的受控基准测试中,MLP二元分类器将39.1%的真实AI智能体误分类为人类,SAINT二元Transformer误分类34.5%;添加显式的智能体类别后,在30次运行(3个模型族×10个种子)中每一次的每类智能体F1均为1.000,彻底消除了这一差距。为了衡量这种检测的抵抗规避能力,我们构建了一个五级规避阶梯,涵盖被动观察、GAN生成轨迹和真实人类光标数据的重放(n=2,299个存档规避会话:1,025个未修改智能体+150个基于规则的+300个GAN+300个GAN++524个人类重放)。在10个种子和3个模型族中,我们在22,990个每种子预测中观察到零智能体漏检:每个级别都有100%的智能体召回率,宏F1的95%置信区间为[0.986,0.994](SAINT)、[0.993,0.997](RF)和[0.993,0.998](GBM)。判别信号是浏览器自动化产物,而非智能体推理的证据。Playwright不会发射物理输入设备产生的原始指针移动和滚轮增量流,而这种缺失特征(点击前无原始事件瞬移、无滚轮增量、空的点击前鼠标移动轨迹)在轨迹操纵下仍然存在。对所有\binom{17}{k}个特征子集(k=1...5;训练9,401个GBM,包含完整的每类精确率和召回率)的穷举搜索表明,少数事件流特征就能恢复强大的智能体检测。两个行为特征(mouse_event_rate、teleport_click_ratio)共同在每个规避级别给出100%的观测智能体召回率,留出测试宏F1为0.926,智能体精确率为0.994;五个特征将宏F1提升至0.991。后向消除找到了一个不同的双特征集{mouse_event_rate,click_duration_std},它也能在单位精确率下保持100%的智能体召回率:信号被冗余编码,完全移除teleport_click_ratio后,智能体检测仍为100%。单特征情形是退化的。一个能标记所有智能体的指标(cursor_path_linearity)通过使分类器崩溃为始终预测“智能体”来实现(智能体精确率0.33,宏F1 0.17),我们的每级诊断会自动浮现这种失败模式。两个特征稳健地隔离智能体;五个特征在宏F1≥0.99时分离所有三类流量。AI智能体检测、特征选择、行为生物特征、对抗性规避、最小特征集

## 1. 引言

我们与互联网交互的方式正在改变。几十年来,网络流量分为两类:*人类*——以意图和运动变异性浏览,以及*机器人*——以编程方式交互的定制脚本、爬虫和自动化框架(iliou2021detection, (https://arxiv.org/html/2607.26935#bib.bib3);jonker2019fingerprint, (https://arxiv.org/html/2607.26935#bib.bib4))。安全行业围绕这种二元区分建立了完整的检测生态系统:CAPTCHA(vonahn2008recaptcha, (https://arxiv.org/html/2607.26935#bib.bib43))、行为生物特征(pusara2004mouse, (https://arxiv.org/html/2607.26935#bib.bib44);ahmed2007mouse, (https://arxiv.org/html/2607.26935#bib.bib45))和商业机器人管理平台都问同一个问题:*是人还是不是?* 现在,第三个角色进入了网络。LLM驱动的智能体(如Anthropic的Computer Use(anthropic2024computeruse, (https://arxiv.org/html/2607.26935#bib.bib16))、OpenAI的Operator(openai2025operator, (https://arxiv.org/html/2607.26935#bib.bib18)),以及WebArena(zhou2024webarena, (https://arxiv.org/html/2607.26935#bib.bib12))、BrowserGym(drouin2024browsergym, (https://arxiv.org/html/2607.26935#bib.bib13))和Mind2Web(deng2024mind2web, (https://arxiv.org/html/2607.26935#bib.bib14))等研究框架)通过真实浏览器自主浏览网页,阅读页面、推理内容并执行多步骤任务。与传统机器人不同,智能体生成可信的DOM事件,根据页面内容调整行为,并追求需要理解的目标。互联网上“谁”和“什么”的区别不再是二元的。

业界已经开始将智能体视为独立的流量类别。例如,Cloudflare的Signed Agents协议(cloudflare2024signedagents, (https://arxiv.org/html/2607.26935#bib.bib17))让智能体以密码学方式自我标识,使平台能够适当地路由、限速并服务每个流量类别。但当智能体不表明身份时,平台只能依赖行为检测,而目前这种行为检测仍然是二元的:人类或机器人。这引出了一个根本性问题:智能体只是另一种机器人吗?如果是,现有的二元检测器应该能捕获它们。我们证明,MLP二元分类器让39.1%的AI智能体以“人类”身份通过,SAINT表格Transformer(somepalli2021saint, (https://arxiv.org/html/2607.26935#bib.bib6))让34.5%通过,随机森林让30.0%通过。只有XGBoost捕获了所有智能体,而且它是通过*巧合*特征(缺失滚动事件、点击前没有原始鼠标移动流、空滚轮增量序列)而非智能体特有信号做到的,因此其检测是脆弱的。这种差距是结构性的,而非建模能力问题:二元标签空间无法表示三类世界。添加第三个“智能体”类别则彻底消除了这一差距(F1 = 1.000)。随后我们证明,判别信号来自浏览器自动化API如何生成事件(程序化DOM调用而非硬件输入),而非LLM推理循环。这留下一个实际问题:部署16个以上行为特征成本高昂。你*实际需要*多少个?我们在API驱动的浏览器自动化(Playwright)环境中研究这个问题,智能体通过生成可信DOM事件的程序化接口与网页交互。我们聚焦于Playwright,因为它是当前智能体生态系统中占主导地位的浏览器驱动底层:Browser Use(browseruse, (https://arxiv.org/html/2607.26935#bib.bib49))、Stagehand (Browserbase)(stagehand, (https://arxiv.org/html/2607.26935#bib.bib50))、Skyvern(skyvern, (https://arxiv.org/html/2607.26935#bib.bib51))以及大多数LangChain/MCP浏览器工具都通过Playwright或几乎相同的Puppeteer/CDP路径分发动作,因此其DOM事件特征正是部署中的Web智能体通常发出的信号。

我们的数据集包含超过14,000个真实人类会话(CaptchaSolve30k)、三种原型架构下的5,000个合成机器人样本,以及1,025个真实智能体会话——这些会话记录自Claude通过Playwright驱动Chrome执行十个Web任务,分为五种交互类型。我们的贡献:

1. (1)我们表明,二元“人类–机器人”检测器会遗漏结构性比例的AI智能体(MLP 39.1%、SAINT 34.5%、随机森林30.0%),而且这种差距是架构性的:三类别形式化能彻底消除它(§6 (https://arxiv.org/html/2607.26935#S6))。
2. (2)我们表明,判别信号是API执行产物而非智能体认知信号:即使智能体重放真实人类光标轨迹,检测仍然有效,因为自动化API仍然通过程序化DOM调用分发动作(§7 (https://arxiv.org/html/2607.26935#S7)、§12 (https://arxiv.org/html/2607.26935#S12))。
3. (3)我们在五种逐渐增强的规避策略下评估鲁棒性,从无规避到GAN生成轨迹再到真实人类光标数据的重放,并在所有级别观察到100%的智能体检测(§7 (https://arxiv.org/html/2607.26935#S7))。
4. (4)我们通过穷举搜索\binom{17}{k}个子集(k=1...5;9,401个GBM)、前向选择和后向消除(§9 (https://arxiv.org/html/2607.26935#S9))识别出实际部署的最小特征子集:
   - 2个行为特征足以在每个规避级别实现100%的智能体召回率,且智能体精确率≥0.99:穷举搜索得到的{mouse_event_rate,teleport_click_ratio},或后向消除得到的{mouse_event_rate,click_duration_std}(留出测试宏F1分别为0.926和0.904)。
   - k=1情形是退化的:唯一一个单独“完美”的指标(cursor_path_linearity)标记所有智能体,但代价是使预测器崩溃为始终输出“智能体”(智能体精确率=0.33,宏F1=0.17)。
   - 5个特征即可达到宏F1≥0.99的完整三类别区分;17个特征达到0.995。
   - 信号是冗余编码的:完全移除teleport_click_ratio后,智能体召回率仍为100%,因为mouse_event_rate、click_duration_std和缺失指示通道吸收了该特征(§9 (https://arxiv.org/html/2607.26935#S9))。

据我们所知,这是首个将LLM驱动的浏览器智能体作为独立于传统机器人的检测类别进行研究的工作,也是首个对行为智能体检测进行穷举特征子集分析的工作。我们详细说明数据集构建(§3 (https://arxiv.org/html/2607.26935#S3))、特征工程(§4 (https://arxiv.org/html/2607.26935#S4))、模型架构(§5 (https://arxiv.org/html/2607.26935#S5))和规避方法(附录D (https://arxiv.org/html/2607.26935#A4))以实现完全可复现性。

## 2. 背景与相关工作

非人类网络流量的演变反映了网页交互本身的演变。每一代自动化参与者都催生了新一代防御手段,而每一种防御都假设当时的行为体分类是完整的。我们追溯这一进程,以说明为什么智能体需要新的检测类别。

相似文章

AI Agent本质上就是静默爬虫

Reddit r/AI_Agents

文章强调了AI Agent悄无声息地爬取网站的普遍现象,并介绍了Vouched的检测系统。该系统由KYA-OS身份层驱动,通过可验证凭据和简单的提示词集成,来识别代理、机器人和人类流量。

CAPTCHAs仍能检测AI代理

Hacker News Top

一项研究论文表明,尽管AI在解决CAPTCHAs方面与人类能力相当,但交互模式中的行为差异仍然可以可靠地区分机器人和人类,从而提出了“过程图灵测试”的概念。

为何AI检测在学术诚信中失效

arXiv cs.LG

本文评估了学术环境中的商业AI检测器,发现对AI辅助的人类写作存在高误报率,而通过人性化工具(humanizers)几乎可以完全规避检测,因此得出结论:检测分数不应作为不当行为的独立证据。