@paul_cal: "该结果对超参数、提示和试图改进它的Fable目标循环具有鲁棒性" 一项新的学术标准…

X AI KOLs Timeline 新闻

摘要

新研究表明,用于AI审计的基于激活的工具,例如 activation oracles 和 SAEs,并不比简单阅读转录本更优越,从而导致了一个稳健的学术标准。

"该结果对超参数、提示和试图改进它的Fable目标循环具有鲁棒性" 一项新的学术标准诞生了
查看原文
查看缓存全文

缓存时间: 2026/08/22 17:30

其结果在超参数、提示词以及试图改进它的Fable目标循环中均表现稳健

一项新学术标准诞生

Adam Karvonen (@a_karvonen): 我们测试了三种在先前审计游戏中取得成功的激活相关工具:激活预言机、自然语言自编码器和SAEs。

没有哪一种能超越直接阅读转录文本的效果。

该结果在超参数、提示词以及试图改进它的Fable目标循环中均表现稳健。

相似文章

AI研究工具仍过于热衷将公开信号转化为确定性

Reddit r/artificial

作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。