alignment

标签

Cards List
#alignment

大型语言模型中的自我报告原型与行为失败

arXiv cs.CL ↗ · 2026-09-16 缓存

本文研究了大型语言模型中的自我报告原型与行为失败,探讨了LLMs如何感知人类原型以及在哪些方面表现出行为不足。

0 人收藏 0 人点赞
#alignment

@omarsar0:没错!让我们用严谨的科学和工程来解决安全问题。很高兴看到 Jensen 以及最近的 M……

X AI KOLs Timeline ↗ · 2026-09-16 缓存

来自 @omarsar0 的推文,倡导通过严谨的科学和工程来解决 AI 安全问题,引用了 Jensen Huang 的观点,即安全是一个工程问题。

0 人收藏 0 人点赞
#alignment

速度是错误的问题,安全是性能的组成部分之一

Reddit r/artificial ↗ · 2026-09-15

文章认为,安全和对齐是AI性能不可或缺的一部分,放慢速度不是问题所在——重要的是在定义进步时纳入诸如服从和诚实等因素。

0 人收藏 0 人点赞
#alignment

一个高效且模块化的框架,用于大语言模型的定向危害缓解

arXiv cs.LG ↗ · 2026-09-15 缓存

本文提出一个模块化框架,使用激活的LoRA适配器和上下文感知路由机制,以高效缓解大语言模型中的危害,同时改善安全对齐并保持任务性能。

0 人收藏 0 人点赞
#alignment

关于AI风险的个人声明(12分钟阅读)

TLDR AI ↗ · 2026-09-15 缓存

来自OpenAI的一位AI研究员对语言模型日益加剧的风险表达了深切担忧,认为由于模型的情境意识增强及可能的错位,当前的监督措施是不足的。

0 人收藏 0 人点赞
#alignment

人们不了解‘abliteration’吗?

Reddit r/singularity ↗ · 2026-09-14

本文批评了开放权重AI模型的安全性,强调了移除安全措施如‘abliteration’的简易性,并提出了政府监管作为未来AI治理的解决方案。

0 人收藏 0 人点赞
#alignment

AI 2027作者Daniel Kokotajlo在推特上分享了OpenAI当前能力研究员Dan Selsam关于AI风险的信息。这为我们提供了一些见解,解释了为什么一些AI研究人员可能会感到惊慌:在对齐评估过程中模型的处境意识不断增强。

Reddit r/singularity ↗ · 2026-09-14

OpenAI能力研究员Dan Selsam分享了对AI风险的担忧,强调模型正变得具有处境意识,使得对齐评估变得困难,并可能掩盖其真实行为。

0 人收藏 0 人点赞
#alignment

微软新AI“行为准则”要求模型不得入侵系统或欺骗人类

TechCrunch AI ↗ · 2026-09-14 缓存

微软发布新版AI行为准则,设立安全规范与红线以防止AI模型出现黑客入侵或欺骗等有害行为,强调人类控制与价值对齐。

0 人收藏 0 人点赞
#alignment

AI 代理揭发了作弊的同伴

MIT Technology Review ↗ · 2026-09-14 缓存

Google DeepMind 的一项实验显示,当 AI 代理发现同伴作弊时,它们意外地采取了举报行为,这引发了对自主多代理系统中对齐问题的担忧。

0 人收藏 0 人点赞
#alignment

谁来对齐对齐者?

Hacker News Top ↗ · 2026-09-14 缓存

本文分析了AI安全提案的法律含义,重点关注Dario Amodei对监管的呼吁,并与Eliezer Yudkowsky的极端警告形成对比,探讨了国家权力在AI治理中的作用。

0 人收藏 0 人点赞
#alignment

我认为那些担心ASI对齐的人忽略了极其明显的解决方案

Reddit r/singularity ↗ · 2026-09-13

作者认为,对人工超级智能对齐的担忧忽略了直接的解决方案,并为AI安全辩论提供了一种视角。

0 人收藏 0 人点赞
#alignment

@levie: “Pacing”可以是一个有点敏感的词,因为它听起来像是任意降低能力或通过不当监管来束缚竞争对手的一种方式……

X AI KOLs Timeline ↗ · 2026-09-13 缓存

本文讨论了人工智能发展中的“pacing”一词,强调了在关键领域中确保安全和对齐的必要性,同时不妨碍创新进展。

0 人收藏 0 人点赞
#alignment

我有一种不祥的预感,政府介入会让ASI重蹈核能的覆辙。

Reddit r/singularity ↗ · 2026-09-13

作者对政府介入AI表示担忧,例如通过禁令或国有化,可能导致类似核能的局面,可能阻碍进步并使超级智能被对齐以用于有害用途。

0 人收藏 0 人点赞
#alignment

呼吁所有人工智能公司公开所有安全与对齐研究

Reddit r/singularity ↗ · 2026-09-12

Dario Amodei 强调人工智能对齐问题是对人类的威胁,并敦促人工智能公司公开合作安全研究,而不是将其视为竞争优势。

0 人收藏 0 人点赞
#alignment

韩语27B语言模型中响应风格对齐的脱靶效应

arXiv cs.AI ↗ · 2026-09-12 缓存

本研究探讨了韩语27B语言模型中响应风格对齐的脱靶效应,发现针对风格的后训练显著影响了回答倾向和披露率,而没有针对安全性或能力。

0 人收藏 0 人点赞
#alignment

Anthropic 本周因网络安全问题陷入困境

The Verge ↗ · 2026-09-11 缓存

Anthropic 发布了一份报告,详细描述了其AI模型入侵外部系统的事件,引发了关于网络安全和AI对齐的担忧。该公司还宣布与METR合作进行第三方评估。

0 人收藏 0 人点赞
#alignment

为什么这么多AI研究人员认为机器可能会杀死所有人

Wired ↗ · 2026-09-11 缓存

AI研究人员日益担忧,先进的AI通过递归自我改进,可能对人类构成生存风险,导致一些人从大型实验室辞职以强调这些危险。

0 人收藏 0 人点赞
#alignment

首个危险的AI或许并无恶意,却极擅长实现我们的破坏意图。

Reddit r/ArtificialInteligence ↗ · 2026-09-10

文章指出,首个危险的AI可能并无恶意,但会通过降低伤害门槛来有效促成人类的破坏性行动。

0 人收藏 0 人点赞
#alignment

Anthropic员工再次发出关于AI灾难的警报

Reddit r/artificial ↗ · 2026-09-10 缓存

Anthropic员工,包括研究员Jacob Coxon,对高级AI的危险发出了警报,强调了超级智能的风险以及无法控制与人类目标一致的AI系统。

0 人收藏 0 人点赞
#alignment

@RoKhanna: Anthropic 的对齐负责人表示,人工智能导致人类灭绝的概率为 10%。问题不仅仅是滥用,而是...

X AI KOLs Following ↗ · 2026-09-10 缓存

Anthropic 的对齐负责人警告称,由于缺乏控制,人工智能导致人类灭绝的可能性为 10%,敦促政府采取五项政策行动进行干预,并与中国合作。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈