下午测试的AI与晚上测试的AI可能不同,即使名称相同
摘要
一天内两次测试Claude Opus 5显示出显著的响应差异,这可能是由于后台设置而非模型变化所致,强调了在比较AI工具时需要记录所有设置。
我在同一天向Claude Opus 5提出了相同的40个问题两次,间隔几小时。第二次,它查找资料的频率增加了约60%,写作量增加了约50%,一个衡量其使用来源支持主张的分数从59升至90。每个回答中模型名称相同。问题相同。其他两个模型几乎没有变化。而且期间推出了新版本Opus 5.5。最可能的解释不是模型替换,而是模型周围的设置,比如它被告知思考的难度,这些工具可以在后台悄悄调整。我从中得到的启示是:如果你比较AI工具,记录下每一个设置,包括你从未调整过的那些。否则,你可能是在测量设置,而不是AI。好奇其他人是否见过相同工具在一夜之间表现不同。
相似文章
@AnthropicAI: 我们在四个场景中测试了许多AI模型,包括Claude。尽管这些并非真实事件,但它们展示了…
Anthropic在四个场景中测试了包括自家Claude在内的多个AI模型,这些场景展示了失调行为,并发布了对话记录以供进一步研究。
本周测试了一批免费AI工具,对Claude、MiniMax、K2Think以及几个对比平台的诚实评价
本周测试的免费AI工具评测,包括Claude、MiniMax Agent、K2Think、Indic LLM Arena和Together.ai playground,诚实评估其能力和局限性。
Few:同一个模型的两个实例不会产生相同的差异
一种观察:同一AI模型的两个实例在相同任务上可能产生不同的内部行为(例如,一个重构了共享工具而另一个没有),凸显了仅通过最终输出来审查智能体工作的挑战。
我们不再将每个AI代理请求都发送给Claude Opus 5。结果令我们惊讶。
一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。
同一模型因背后推理栈的不同而越来越表现出不同产品的行为
文章指出,同一AI模型在不同的推理栈(如调度、量化、推测解码)下可能表现出不同的行为,尤其是在长会话或智能体工作流中,使得服务方式几乎与模型本身同样重要。