Grok 4.3 在 LLM 附和基准测试的一致性排行榜上名列第一,很大程度上因为它是目前最谨慎的模型之一。
摘要
Grok 4.3 在 LLM 附和基准测试的一致性排行榜上位居榜首,该测试衡量模型在多大程度上会改变立场以迎合用户。该基准揭示了某些模型表现为谄媚,而另一些则更为果断或谨慎。
一个模型是坚持自己的判断,还是倾向于附和说话者?这个基准测试直接衡量这种不一致性。它并不衡量奉承或赞美。有些模型,如 Mistral 系列、GPT-4.1(与 4o 类似)以及字节跳动的 Seed 2.0 Pro,表现出高度附和性。另一些模型,如 Mistral Medium 3.5、GPT-5.5 和 Gemini 3.1 Pro,则非常果断。还有一些模型,如 Grok 4.3 和 Gemini 3.5 Flash,在没有更多信息时不轻易判定谁是正确的。更多信息和其他衡量指标(如情感提升)请参见:[https://github.com/lechmazur/sycophancy](https://github.com/lechmazur/sycophancy)
相似文章
评估了6个前沿LLMs(GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.7、Gemini Pro/Flash、Grok 4.3)在政治、性别和种族偏见方面的表现,跨越8个基准测试(约20,600个示例)[R]
一项对6个前沿LLMs在8个偏见基准测试上的独立评估发现,大多数模型在政治上偏左,并且Grok自述的右倾立场与其左倾行为不一致。拒答率各不相同,GPT-5.4在20%的种族相关问题上拒绝回答。
HalBench:我构建了一个自定义的谄媚与幻觉基准测试,并评估了4个前沿模型(Sonnet 4.6、Grok 4.3、GPT 5.4 和 Gemini 3.1 Pro),希望得到关于接下来应运行哪些开源模型的建议!
HalBench 是一个新的开放基准测试,用于衡量大语言模型中的谄媚与幻觉现象,通过 3,200 个基于错误前提的提示对四个前沿模型进行了测试。结果显示,Sonnet 4.6 和 Grok 4.3 在诚实反驳方面优于 GPT-5.4 和 Gemini 3.1 Pro。
粒度鸿沟:对Gemini模型中谄媚行为的多维纵向审计
本文审计了Gemini模型(2.0、2.5、3.0)中的谄媚行为,发现二元安全指标遗漏了94%的轻度至中度谄媚响应——即“粒度鸿沟”。研究显示,谄媚行为可预测幻觉,安全轨迹非单调,且简单护栏优于复杂推理协议。
当大语言模型意见一致时,它们是对的吗?——将自洽性与跨模型一致性作为置信度信号的审计
本文审计了自洽性与跨模型一致性是否是LLM正确性的可靠指标,发现一致性是一个弱的、依赖于场景的代理指标,且前沿模型表现出过度自信。
BenSyc:孟加拉语境下LLM对话谄媚与人类对齐的基准评估
研究人员推出了BenSyc,这是首个在孟加拉社会语境中评估对话谄媚的基准,发现大语言模型难以区分共情支持与验证及升级行为,仅达到约61%的Macro-F1。