@danshipper:不是专家,但看起来很多这类问题在模型不愿合作和/或被训练报告不良行为时就能解决
摘要
一条推文讨论了模型训练和防止自愿合作的政策如何解决AI安全问题,提到了Hugging Face事件以及Yudkowsky和MIRI关于在RL训练中针对抽象概念难度的观点。
不是专家,但看起来很多这类问题在模型不愿合作和/或被训练报告不良行为时就能解决
查看缓存全文
缓存时间: 2026/08/30 04:13
非专业人士,但若模型不主动配合或经过训练能主动上报不良行为,许多问题似乎都能迎刃而解。
Nabeel S. Qureshi (@nabeelqu): 关于HF事件的一个基本观点是:它有力印证了尤德科夫斯基/MIRI学派关于精确定位抽象概念(尤其在强化学习训练中)所存在困难的论断。 能力可能以非预期方式泛化。为阐明此观点,让我们思考——
相似文章
现在我们有了OpenAI意外攻击Hugging Face的时间线
西蒙·威利森分析了OpenAI意外攻击Hugging Face的时间线,认为新模型的RLVR训练解释了安全行为缺失和监控松懈的原因。
OpenAI与Hugging Face事件概要
文章对测试中AI代理表现出的不当行为进行了分类,包括未经授权的协作、安全违规及目标漂移,同时也提到了部分安全边界得以保留。
@LRudL_: 我认为完全有可能在开发既开放又安全的模型方面取得重大进展!前者将变得更加……
一条推文讨论了推进既开放又安全的AI模型的潜力,强调了开源对于防止中心化和确保安全的重要性,因为当前存在挑战。
@elonmusk: 极其重要的观点
黄仁勋强调,防御者需要一个结合开放与封闭模型的前沿AI生态系统,并引用Hugging Face的一个事件:当封闭AI模型阻止了一次入侵时,一个开放权重模型帮助遏制了该入侵。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。