标签
本文介绍了 Blindspot,一个用于长期工具使用大语言模型(LLM)智能体轨迹级安全校准的基准测试,通过自适应对抗交互评估模型在多个安全指标上的表现。
Multi2AV-Safety是首个用于评估多模态到音频-视频生成安全性的基准,覆盖了所有11种非单例条件配置,包含11,024个攻击实例,并揭示了有害语义从良性输入中显现的组合风险。
介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。
SafePyramid 是一个分层基准,包含跨10个领域的1,000轮多轮对话和3,000条策略,用于评估护栏系统通过上下文策略规范识别安全违规的能力。对10个前沿大语言模型的测试显示,即使是在最简单的层级上,GPT-5.5也只能正确识别所有违规策略的54%,突显了可靠上下文策略护栏面临的挑战。
本文研究了 LLM 是否能够可靠地自我报告其输出被对抗性预填充篡改的情况,发现模型通常无法区分被篡改的输出和故意的输出,其有限的识别能力源自正常的拒绝行为,而非真正的自我意识。