标签
这篇 arXiv 论文提出了一种三分类检测框架,用于区分人类、机器人和 AI 智能体,并表明二元分类器会系统性地错误分类智能体。它确定了最小特征集(例如 mouse_event_rate 和 teleport_click_ratio),这些特征集在各种规避级别下都能实现完美的智能体召回率。
本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。
本文描述了LoRA适配器中在令牌特征层面激活的后门,并提出了行为级和权重级检测方法。该后门在相关令牌模式上泛化,但在结构相同的模式上不泛化,检测方法表现出强分离性。