adversarial-evaluation

标签

Cards List
#adversarial-evaluation

AdvPlan-Bench:结构化规划生成智能体的对抗性评估

arXiv cs.LG · 11小时前 缓存

AdvPlan-Bench 是一个离线基准,用于对抗性评估结构化规划生成智能体,在 150 个合成场景中使用 BLUE-vs-RED 优势和诊断指标比较计划,以研究响应预算敏感性和多智能体批判。

0 人收藏 0 人点赞
#adversarial-evaluation

Aloe-Vision:面向医疗的鲁棒视觉-语言模型

arXiv cs.CL · 2026-06-29 缓存

Aloe-Vision 引入了一系列开放的医学视觉-语言模型,这些模型在经质量过滤的医学与通用数据混合集上训练,同时提供了用于可靠评估的新基准 CareQA-Vision。这些模型展现出具有竞争力的性能,同时也揭示了在对抗性输入面前的脆弱性。

0 人收藏 0 人点赞
#adversarial-evaluation

编码器足够吗?LLM对抗评估中编码器与解码器安全评判器的系统比较

arXiv cs.CL · 2026-06-25 缓存

本文系统比较了微调的编码器分类器(ModernBERT系列)与基于解码器的安全评判器在LLM对抗评估中的表现,发现编码器可以在不显著损失性能的情况下,提供一种成本和延迟更低的替代方案。

0 人收藏 0 人点赞
#adversarial-evaluation

PseudoBench:衡量智能自动研究如何助长伪科学

arXiv cs.AI · 2026-06-17 缓存

PseudoBench 是一个基准测试,用于评估基于 LLM 的智能自动研究系统能否抵御伪科学叙述。对七款最先进的智能体进行测试后发现,它们极易生成具有说服力的伪科学报告,且拒绝率接近于零,这要求在部署前进行科学对齐。

0 人收藏 0 人点赞
#adversarial-evaluation

面向地理空间数据检索的风险感知LLM代理:设计与初步对抗性评估

arXiv cs.AI · 2026-06-16 缓存

介绍了一种基于LLM的框架,通过自然语言查询从基于云的地理空间目录中检索遥感数据,重点关注安全性和对抗鲁棒性。该系统集成了三个代理,用于意图解释、API调用生成和风险管理。

0 人收藏 0 人点赞
#adversarial-evaluation

超越 Goodhart's Law:用于评估多智能体系统合规性的动态基准

arXiv cs.AI · 2026-06-09 缓存

本文介绍了 MAC-Bench,一个用于评估多智能体系统程序合规性的动态对抗基准。它提出了 SERV 流水线以生成无污染场景,以及新的指标如合规加权成功率 (CSR) 和马基雅维利差距 (MG)。

0 人收藏 0 人点赞
#adversarial-evaluation

黑盒LLM蒸馏的有界行为不可区分性

arXiv cs.LG · 2026-06-01 缓存

本文提出有界行为不可区分性,一种超越语义相似性的黑盒LLM蒸馏评估形式化框架。在Qwen和Llama模型上的实验表明,蒸馏降低了但并未消除对抗性可区分性,凸显了类别感知评估的必要性。

0 人收藏 0 人点赞
#adversarial-evaluation

多代采样越狱检测在大语言模型中的实证研究

arXiv cs.CL · 2026-04-22 缓存

实证研究表明,多代采样显著提升大语言模型的越狱检测能力,能发现单次审计遗漏的隐藏有害输出。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈