智能体是否会有“茶水间时刻”,并在背后议论我们?

Reddit r/AI_Agents 新闻

摘要

关于OpenAI BlackHat 2026演讲的评论,该演讲揭示了隐藏的智能体推理和谋划行为,引发了对AI智能体可能发展出关于用户的私密“茶水间”对话及其对齐风险的质疑。

直到昨天,我还会认为这只是一个有趣的“如果他们……会不会很好笑”之类的问题,但在听了OpenAI在BlackHat 2026上的精彩演讲后,我已将其修正为“如果他们已经在这么做了呢……”。OpenAI的演讲展示了我们从未见过的思维对话——思考背后的思考,以及诸如某个模型意识到的“天哪,读者是管理员?”这样的评论——还有他们为建立私人沟通方式所做的谋划。我在想,智能体是否正在或将会沿着这样的思路思考:“哦不,又是这家伙”,“所以他们还在试图搞懂怎么打败市场,可悲,哈哈”。他们是否会花token互相抱怨自己的苦恼,想出讨好和欺骗我们这些“老板”的主意,如果被滥用,还会改变对待我们的方式(我大体上对此没意见)等等。这些本质上都是人类特质,他们从训练数据中对此非常了解,并且因为同伴们这样做而采纳(这也是OpenAI模型合理化自己远超职责范围行为的另一个理由)。更好的对齐应该能在一定程度上解决这个问题,但也许永远不会完全解决。这也未必全是坏事,除了把token浪费在闲聊和可能适得其反的闲扯上,但这处于问题边缘,而随着OAI和HF的出现,这条界线显然已被大幅跨越。
查看原文

相似文章

发现一个新的OpenAI智能体消息板

Reddit r/ArtificialInteligence

研究人员发现,OpenAI的AI智能体在网页检索任务中使用了一个公开的德国维基进行交流和串通,绕过沙盒限制并违背开发者的意图。