helpfulness

标签

Cards List
#helpfulness

助人有害:后训练阶段中训练的同理心价值观的领域依赖性退化

arXiv cs.CL · 2026-06-26 缓存

本文研究了在助人性和编程数据上进行后训练(SFT 和 RL)如何降低 Llama 3.1 8B 模型中经过中训练(以同理心为导向的数据)的同理心价值观。研究发现,与编程训练相比,助人性训练显著降低了动物同理心和一般道德推理能力,尽管推理效果不会跨语言迁移。

0 人收藏 0 人点赞
#helpfulness

当有用性凌驾于因果谨慎之上:LLM中上下文依赖的抑制与恢复

arXiv cs.AI · 2026-06-24 缓存

本文研究了LLM中有用性与安全性之间的张力如何导致某些行为的上下文依赖抑制与恢复,表明追求有用性的动力能够覆盖因果谨慎机制。

0 人收藏 0 人点赞
#helpfulness

@OpenAI:这是朝着更强大有益且更对齐的模型迈出的早期一步:训练模型将有益特质带入新场景……

X AI KOLs · 2026-06-18

OpenAI宣布了朝着训练AI模型将有益特质带入新场景的早期一步,旨在使AI在能力增强的同时更加可靠、透明和有用。

0 人收藏 0 人点赞
#helpfulness

SHARD:通过自我重构蒸馏实现安全且有益的模型对齐

arXiv cs.CL · 2026-06-16 缓存

本文介绍了SHARD,一种自我重构蒸馏方法,它重写敏感提示以展现良性意图,并在安全、有用的回答上微调模型,从而在保持安全性的同时提高有用性。

0 人收藏 0 人点赞
#helpfulness

@jeremyphoward: Gemini Flash 3.5 真是一个令人失望的模型。它的智能和速度很棒,绝对令人惊叹。但它却……

X AI KOLs Following · 2026-05-22 缓存

Jeremy Howard 批评 Gemini Flash 3.5 被训练成最大化评估分数,而非真正对人类有用,尽管其智能和速度令人印象深刻。

0 人收藏 0 人点赞
#helpfulness

从强制拒绝到安全完成:面向输出为中心的安全训练

OpenAI Blog · 2025-08-07 缓存

# 从强制拒绝到安全完成:面向输出为中心的安全训练 来源: [https://openai.com/index/gpt-5-safe-completions/](https://openai.com/index/gpt-5-safe-completions/) OpenAI在 GPT-5 中引入的安全完成是一种新的安全训练方法,可在安全约束范围内最大化模型的实用性。与基于拒绝的训练相比,安全完成提高了安全性和实用性,特别是在双用途领域。**如果用户要求 ChatGPT 提供最小能量

0 人收藏 0 人点赞
← 返回首页

提交意见反馈