safety-benchmark

标签

Cards List
#safety-benchmark

BLINDSPOT: 长期工具使用智能体的安全与拒绝校准基准测试

arXiv cs.AI ↗ · 2026-09-16 缓存

本文介绍了 Blindspot,一个用于长期工具使用大语言模型(LLM)智能体轨迹级安全校准的基准测试,通过自适应对抗交互评估模型在多个安全指标上的表现。

0 人收藏 0 人点赞
#safety-benchmark

Multi2AV-Safety:多模态到音频-视频生成的安全基准测试

arXiv cs.AI ↗ · 2026-08-28 缓存

Multi2AV-Safety是首个用于评估多模态到音频-视频生成安全性的基准,覆盖了所有11种非单例条件配置,包含11,024个攻击实例,并揭示了有害语义从良性输入中显现的组合风险。

0 人收藏 0 人点赞
#safety-benchmark

SurakshaEval:面向多语言大语言模型的印度语言安全基准

arXiv cs.CL ↗ · 2026-08-11 缓存

介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。

0 人收藏 0 人点赞
#safety-benchmark

SafePyramid:面向上下文策略护栏的分层基准

Hugging Face Daily Papers ↗ · 2026-06-29 缓存

SafePyramid 是一个分层基准,包含跨10个领域的1,000轮多轮对话和3,000条策略,用于评估护栏系统通过上下文策略规范识别安全违规的能力。对10个前沿大语言模型的测试显示,即使是在最简单的层级上,GPT-5.5也只能正确识别所有违规策略的54%,突显了可靠上下文策略护栏面临的挑战。

0 人收藏 0 人点赞
#safety-benchmark

@rohanpaul_ai: LLM 常常无法判断攻击是否导致它们说出了不安全的内容。询问一个 LLM 它自己之前的回答是否……

X AI KOLs Timeline ↗ · 2026-06-24 缓存

本文研究了 LLM 是否能够可靠地自我报告其输出被对抗性预填充篡改的情况,发现模型通常无法区分被篡改的输出和故意的输出,其有限的识别能力源自正常的拒绝行为,而非真正的自我意识。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈