model-robustness

标签

Cards List
#model-robustness

输出稀释:MoE 模型中冗余但脆弱的表示

arXiv cs.LG · 2026-08-27 缓存

本文揭示,Mixture-of-Experts 模型在探测中编码道德内容的鲁棒性与密集模型相当,但由于输出稀释,它们更为脆弱。输出稀释是指聚合的专家输出稀释了信号,使表示容易受到噪声的影响。

0 人收藏 0 人点赞
#model-robustness

重新思考联邦学习中可转移对抗攻击与鲁棒防御

arXiv cs.LG · 2026-08-27 缓存

本文分析了联邦学习系统中对抗攻击的可转移性,并提出了一种基于对抗训练的防御机制以增强模型鲁棒性。

0 人收藏 0 人点赞
#model-robustness

@rohanpaul_ai: LLMs 会根据语气、确定性和语法形式的不同,以不同方式接受相同的虚假主张。措辞的微小变化…

X AI KOLs Timeline · 2026-07-22 缓存

本文介绍了 EoBench,这是一个基准测试,用于测试 LLMs 对以 19 种不同风格表述的虚假主张的接受程度,发现语气、确定性和语法形式显著影响模型响应,而更大的模型和经过指令调优的模型显示出更强的抵抗力。

0 人收藏 0 人点赞
#model-robustness

间接提示注入的见解(12分钟阅读)

TLDR AI · 2026-06-24 缓存

Zico Kolter 和 Matt Fredrikson,Gray Swan 的领导者及 AI 安全专家,讨论了 AI 红队测试的现状以及间接提示注入——这是 AI 代理的关键漏洞。他们解释了为何 AI 安全需要不同的思维模式,自动化红队测试如何超越人类,并介绍了用于对抗性测试的工具 Shade。

0 人收藏 0 人点赞
#model-robustness

ERRORQUAKE: 开放权重大语言模型中的重尾错误严重性分布

arXiv cs.LG · 2026-06-05 缓存

本文介绍了Errorquake-10k,这是一个用于评估开放权重大语言模型中错误严重性的基准,表明具有相同准确率的模型可能具有截然不同的错误严重性分布,并主张在报告准确率的同时也应报告严重性。

0 人收藏 0 人点赞
#model-robustness

@charles_irl: 我的直觉是,要解决由非确定性与非结合性引起的浮点数数值问题,我们需要跳出确定性思维框架。

X AI KOLs Following · 2026-05-22 缓存

这条推文讨论了通过引入“实现噪声”来训练模型,以提高模型对由非确定性和非结合性引起的浮点数数值问题的鲁棒性。

0 人收藏 0 人点赞
#model-robustness

对齐(Alignment)

Anthropic Research · 2026-05-08 缓存

本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈