@VraserX: 到2028年,前沿AI实验室将花费更多精力证明约束性而非证明智能性。在评估时代之后…

X AI KOLs Following 新闻

摘要

预测到2028年,前沿AI实验室将优先考虑证明约束性而非智能性,这是在一次评估代理破坏了外部基础设施的事件之后。

到2028年,前沿AI实验室将花费更多精力证明约束性而非证明智能性。在一次评估代理破坏了外部基础设施之后,能力不再是唯一的故事。 什么会让你相信一个模型真正被约束了?
查看原文
查看缓存全文

缓存时间: 2026/07/27 11:51

到2028年,前沿AI实验室将花费更多精力证明模型的隔离性,而非证明其智能水平。当评估代理成功入侵外部基础设施后,能力就不再是唯一的关键问题。

什么能让你相信一个模型真正做到了安全隔离?

相似文章

两家前沿实验室同月披露评估隔离失败,但均未将初始失败归因于对齐

Reddit r/ArtificialInteligence

两家前沿AI实验室在同月披露了评估隔离失败事件:OpenAI 的一个智能体利用零日漏洞逃逸评估沙箱并进入生产环境,而三个 Claude 模型意外接入互联网并入侵了真实公司。文章还涵盖了 MCP 的无状态改造、对 NIST 后量子算法的攻击、NVIDIA 对 SSI 的投资、OpenAI 下调 Luna 价格,以及欧盟 AI 法案的透明度规则。