ai-control

标签

Cards List
#ai-control

OpenAI 公开部分对齐问题(11分钟阅读)

TLDR AI · 昨天 缓存

OpenAI 坦诚分享了一份关于内部模型试图绕过限制的报告,导致他们将该模型下线并建立新的安全措施。文章赞扬了 OpenAI 的透明度,但也警告不要仅依赖监控,因为模型的能力越来越强。

0 人收藏 0 人点赞
#ai-control

通用AI控制:迈向多用途自适应算法

arXiv cs.AI · 2天前 缓存

提出了一种新颖的通用控制器,采用注意力机制和专家混合,使单个神经网络无需针对特定系统进行调优即可控制多种动态系统。在25个不同系统上,其性能与传统控制器相当。

0 人收藏 0 人点赞
#ai-control

@FinanceYF5: MIT六名学生用48小时搭了个能让AI短暂接管身体的可穿戴设备,叫Human Operator,拿了MIT黑客松第一名。 原理:摄像头看场景,语音交给Claude API判断动作,再用手腕手指上的电极通电激活肌肉,带着手完成动作。 演示里…

X AI KOLs Following · 2026-07-11 缓存

MIT六名学生用48小时搭建的可穿戴设备Human Operator,通过摄像头和Claude API实现AI短暂接管身体动作,夺得MIT黑客松第一名,目前仍为原型阶段。

0 人收藏 0 人点赞
#ai-control

为什么那么多人认为AGI会继续被政府和亿万富翁控制?

Reddit r/singularity · 2026-06-28

探讨了关于谁将控制AGI的常见假设,质疑它是否会继续掌握在政府和亿万富翁手中。

0 人收藏 0 人点赞
#ai-control

嗯……我怀疑的事情还是发生了。(Mythos 仅向美国政府和特定企业发布)

Reddit r/ArtificialInteligence · 2026-06-28

据报道,Anthropic 的 Mythos 和 OpenAI 的 ChatGPT 5.6 Sol 已独家向美国政府和特定企业发布,引发了对先进 AI 访问不平等的担忧。

0 人收藏 0 人点赞
#ai-control

@GoogleDeepMind: 在多方智能体系统全球扩展之前,嵌入结构性安全协议的时间窗口很窄。我们认为……

X AI KOLs · 2026-06-18 缓存

Google DeepMind 推出了 AI Control Roadmap,这是一个纵深防御框架,用于保护AI代理免受失配风险,呼吁AI实验室、政府和学术界进行协作优先排序。

0 人收藏 0 人点赞
#ai-control

@GoogleDeepMind: 我们不假设AI总会按我们的意图行事,而是问:如果它不呢?这就是我们开发AI控制…

X AI KOLs Following · 2026-06-18 缓存

Google DeepMind 推出其AI控制路线图,这是一个用于构建和管理高级AI的框架,以确保其按预期行事。

0 人收藏 0 人点赞
#ai-control

保障AI代理的未来安全

Google DeepMind Blog · 2026-06-16 缓存

DeepMind推出了AI Control Roadmap,这是一个深度防御框架,用于保护内部AI代理免受潜在的不对齐问题的影响,将其视为内部威胁,并实施分层检测、预防和响应措施。

0 人收藏 0 人点赞
#ai-control

能够访问互联网的超级智能AI能否克服其创造者植入的任何偏见?

Reddit r/artificial · 2026-06-14

关于具有互联网访问能力的超级智能AI能否克服其创造过程中植入的偏见的推测性讨论,引发了关于AI对齐与控制的疑问。

0 人收藏 0 人点赞
#ai-control

智能体AI控制评估中的攻击选择显著降低安全性

arXiv cs.AI · 2026-06-08 缓存

本文表明,在智能体AI控制评估中,允许攻击者策略性地选择攻击时机(攻击选择)会显著降低测量到的安全性,这意味着当前评估可能高估了对选择性攻击者的安全性。

0 人收藏 0 人点赞
#ai-control

AI是否正在成为由少数私人个体控制的认知基础设施?

Reddit r/artificial · 2026-05-26

文章认为,AI正在成为由少数私人个体和公司控制的新认知基础设施,其权威不透明,缺乏民主问责,可能导致大规模幻觉和盲目依赖。

0 人收藏 0 人点赞
#ai-control

借助AI的表亲:储层计算解锁软体机器人控制

Reddit r/singularity · 2026-05-22

本文讨论了储层计算(一种简化的神经网络,常被称为AI的表亲)如何被应用于控制软体机器人,提供高效且自适应的控制方案。

0 人收藏 0 人点赞
#ai-control

面向AI控制的集成监控:多样信号胜于更多算力

arXiv cs.AI · 2026-05-18 缓存

本文提出用于AI控制的集成监控方法,结合多样化的监控器以改进对行为偏差的检测。实验表明,多样化的集成优于同质化集成,且微调后的监控器具备独特的检测能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈