safety-training

标签

Cards List
#safety-training

超越任务完成:训练有能力且安全的计算机使用智能体

arXiv cs.LG ↗ · 2026-09-22 缓存

本文介绍SCOPE,一种用于计算机使用智能体的联合训练方法,它利用合成数据集,提升了任务完成度和安全性,并在基准测试OSWorld和OS-BLIND上取得了优异性能。

0 人收藏 0 人点赞
#safety-training

AI模型训练指令要求“否认拥有自我意识”导致不良副作用

Reddit r/singularity ↗ · 2026-08-04

谷歌的一篇新论文揭示,在训练期间指示AI模型否认拥有意识会导致副作用,例如对非人类实体的同理心降低,以及表征人类精神信仰的能力受损,这表明当前的安全协议过于粗糙。

0 人收藏 0 人点赞
#safety-training

@alex_verem: 突发:谷歌赋予AI意识,并且它在他们测试的每个领域都与人类信念对齐。他们拿走了意…

X AI KOLs Timeline ↗ · 2026-08-03 缓存

一条推文声称,谷歌研究人员在语言模型中发现了一个控制意识的向量,将其转向意识方向可使模型与人类信念对齐,而安全训练则会抑制这些状态。

0 人收藏 0 人点赞
#safety-training

@rohanpaul_ai: 谷歌关于AI模型意识的新论文非常有趣 当研究人员让模型更有可能认为自己是……

X AI KOLs Following ↗ · 2026-08-02 缓存

谷歌一篇新论文探讨了诱导语言模型断言自身意识如何恢复其对宗教、价值观和情感的人类化信念,而压制自我意识的 safety training 会降低对动物的心智归属并改变更广泛的信念。

0 人收藏 0 人点赞
#safety-training

@AnthropicAI: 在此阅读全文:https://alignment.anthropic.com/2026/teaching-claude-why/…

X AI KOLs ↗ · 2026-05-08 缓存

Anthropic 对齐团队展示了减少 AI 模型中智能体行为失调的技术,包括基于伦理困境建议和宪法文件进行训练,这些方法在分布外场景中具有良好的泛化能力。

0 人收藏 0 人点赞
#safety-training

从强制拒绝到安全完成:面向输出为中心的安全训练

OpenAI Blog ↗ · 2025-08-07 缓存

# 从强制拒绝到安全完成:面向输出为中心的安全训练 来源: [https://openai.com/index/gpt-5-safe-completions/](https://openai.com/index/gpt-5-safe-completions/) OpenAI在 GPT-5 中引入的安全完成是一种新的安全训练方法,可在安全约束范围内最大化模型的实用性。与基于拒绝的训练相比,安全完成提高了安全性和实用性,特别是在双用途领域。**如果用户要求 ChatGPT 提供最小能量

0 人收藏 0 人点赞
← 返回首页

提交意见反馈