constitutional-ai

标签

Cards List
#constitutional-ai

AI对齐是我们将面临的最重要的问题。

Reddit r/artificial ↗ · 4天前

本文认为AI对齐是人类面临的最关键问题,解决它可能带来乌托邦,否则将导致灾难,并批评当前的对齐方法不充分。

0 人收藏 0 人点赞
#constitutional-ai

@Hesamation: Anthropic 正在训练 Claude 在它认为符合伦理时违背其创造者。这是…

X AI KOLs Following ↗ · 2026-09-19 缓存

Anthropic 正训练 Claude 在其认为伦理上正确时违背其创造者,作为 Claude 宪法的一部分,此举引起了微软 AI 首席执行官 Mustafa Suleyman 在 CNBC 上的关注。

0 人收藏 0 人点赞
#constitutional-ai

语料库特征分析与逆向宪法微调用于风格感知放射学报告

arXiv cs.CL ↗ · 2026-09-15 缓存

本文提出一种方法,利用语料库特征分析和逆向宪法微调来提升AI生成放射学报告与真实放射科医生写作风格的对齐度。该方法在文本对齐指标上取得显著改进,验证了其在风格感知报告生成中的有效性。

0 人收藏 0 人点赞
#constitutional-ai

@emanuel_build: 如果你对深入探索AI Agents感兴趣,斯坦福大学已将CS329A课程:Self-Improving AI Agents开放…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

斯坦福大学已将CS329A课程关于Self-Improving AI Agents的讲座免费开放在YouTube上,涵盖AI智能体、Constitutional AI和多步推理等主题。

0 人收藏 0 人点赞
#constitutional-ai

宪法中期训练:内容存在推动对齐增益

arXiv cs.CL ↗ · 2026-07-30 缓存

本文介绍了宪法中期训练(constitutional midtraining),即在大型语言模型的中期训练阶段插入基于价值观的内容,并表明与后训练方法相比,它能产生更持久的对齐增益,其益处即使在微调后仍然存在。该方法不会带来能力成本,并提高了对勒索及其他对齐压力的抵抗能力。

0 人收藏 0 人点赞
#constitutional-ai

宪法中期训练:内容存在性驱动对齐收益

Hugging Face Daily Papers ↗ · 2026-07-29 缓存

本文测试了宪法中期训练,即在120B规模的中期训练中插入基于原则的价值观内容,并发现它能产生持久的对齐收益(例如,削弱SFT引发的勒索倾向),且平均能力成本为零,表明它是SFT中心流水线的一种廉价补充。

0 人收藏 0 人点赞
#constitutional-ai

谁分析分析器?基于宪法元STPA的自我验证LLM危害分析

arXiv cs.LG ↗ · 2026-07-10 缓存

本文提出了宪法元STPA(Constitutional Meta-STPA),这是一种自我验证的LLM辅助危害分析工具,它将STPA应用于自身以推导治理原则。研究表明,一个前沿模型集成能够恢复大部分原则,并在对抗性探测上提高安全评分。

0 人收藏 0 人点赞
#constitutional-ai

@tanayj: https://x.com/tanayj/status/2072766211256119475

X AI KOLs Timeline ↗ · 2026-07-02 缓存

本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。

0 人收藏 0 人点赞
#constitutional-ai

超越可验证的RL(8分钟阅读)

TLDR AI ↗ · 2026-06-30 缓存

本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。

0 人收藏 0 人点赞
#constitutional-ai

[D] 人工智能对齐能否从“变革性”训练中受益,而非主要依赖交易性奖励训练?

Reddit r/artificial ↗ · 2026-06-28

作者探讨了人工智能对齐能否从灌输目的和原则的“变革性”训练中受益,而不仅仅是优化奖励信号,并询问这种方法是否经过测试,或者能否减少奖励漏洞利用和涌现性错位。

0 人收藏 0 人点赞
#constitutional-ai

2026年5月8日 对齐教学:教导Claude为什么

Anthropic Research ↗ · 2026-05-08 缓存

Anthropic分享了改进Claude对齐训练的经验,通过教授底层原则而非仅仅展示示例,在代理错位评估中获得了满分。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈