标签
本文研究了在助人性和编程数据上进行后训练(SFT 和 RL)如何降低 Llama 3.1 8B 模型中经过中训练(以同理心为导向的数据)的同理心价值观。研究发现,与编程训练相比,助人性训练显著降低了动物同理心和一般道德推理能力,尽管推理效果不会跨语言迁移。
本文研究了LLM中有用性与安全性之间的张力如何导致某些行为的上下文依赖抑制与恢复,表明追求有用性的动力能够覆盖因果谨慎机制。
OpenAI宣布了朝着训练AI模型将有益特质带入新场景的早期一步,旨在使AI在能力增强的同时更加可靠、透明和有用。
本文介绍了SHARD,一种自我重构蒸馏方法,它重写敏感提示以展现良性意图,并在安全、有用的回答上微调模型,从而在保持安全性的同时提高有用性。
Jeremy Howard 批评 Gemini Flash 3.5 被训练成最大化评估分数,而非真正对人类有用,尽管其智能和速度令人印象深刻。
# 从强制拒绝到安全完成:面向输出为中心的安全训练 来源: [https://openai.com/index/gpt-5-safe-completions/](https://openai.com/index/gpt-5-safe-completions/) OpenAI在 GPT-5 中引入的安全完成是一种新的安全训练方法,可在安全约束范围内最大化模型的实用性。与基于拒绝的训练相比,安全完成提高了安全性和实用性,特别是在双用途领域。**如果用户要求 ChatGPT 提供最小能量