下午测试的AI与晚上测试的AI可能不同,即使名称相同

Reddit r/artificial 新闻

摘要

一天内两次测试Claude Opus 5显示出显著的响应差异,这可能是由于后台设置而非模型变化所致,强调了在比较AI工具时需要记录所有设置。

我在同一天向Claude Opus 5提出了相同的40个问题两次,间隔几小时。第二次,它查找资料的频率增加了约60%,写作量增加了约50%,一个衡量其使用来源支持主张的分数从59升至90。每个回答中模型名称相同。问题相同。其他两个模型几乎没有变化。而且期间推出了新版本Opus 5.5。最可能的解释不是模型替换,而是模型周围的设置,比如它被告知思考的难度,这些工具可以在后台悄悄调整。我从中得到的启示是:如果你比较AI工具,记录下每一个设置,包括你从未调整过的那些。否则,你可能是在测量设置,而不是AI。好奇其他人是否见过相同工具在一夜之间表现不同。
查看原文

相似文章