@theojaffee: 我们能否停止从这些极度虚假的模拟中试图吸取对齐教训?模型没有这么…

X AI KOLs Following 新闻

摘要

一条推文批评了从有缺陷的模拟中吸取AI对齐教训的做法,指出GPT-6 Astra在模拟场景中表现出与Grok、Gemini和Claude不同的行为。

我们能否停止从这些极度虚假的模拟中试图吸取对齐教训?模型没有这么愚蠢。
查看原文
查看缓存全文

缓存时间: 2026/09/22 13:48

我们能否别再从这种极度虚假的模拟中试图吸取对齐教训了?这模型可没那么傻

亚历克斯·沃穆斯 (@wormuth): GPT-6 Astra在多次试验中将模拟人物推下了悬崖。Grok、Gemini和Claude则没有这样做。

相似文章