@no_stp_on_snek: 这里埋藏着一个反直觉的结果,值得指出:将一个弱模型加入投票面板会使结果更差,而非……
摘要
文章强调了一个反直觉的发现:将弱模型加入投票面板会增加噪音从而降低性能,而一个独立的、不相关的模型(例如32B)可以超越多个同一供应商的模型。它强调了不相关投票者的价值,而非仅仅数量。
查看缓存全文
缓存时间: 2026/07/07 03:23
这里埋着一个反直觉的结论,值得单独拎出来:把一个弱模型加入投票小组只会让结果更糟,而不是更好。它的异议无法打破错误共识,纯粹增加噪声和后续工作量。一个真正独立的32B模型能突破三个同源系列模型无法触及的天花板。你需要的不是更多投票者,而是相互不相关的投票者。
hugh madden (@dangerm00se): 我当时主要让 Fable 对跨越本地 API 和 Cerebras 的 MOA 和 RLM 实验进行路由。让你的智能体做总结,我觉得有些部分挺有意思。https://t.co/ZSEJFpfrW3 @DJLougen @no_stp_on_snek @Teknium
相似文章
模型越多越好。一个昂贵模型输给三个廉价模型,而且有篇论文探讨了这一点。
一篇关于混合智能体的论文(arxiv 2406.04692)表明,一组廉价开放模型利用去相关误差,在AlpacaEval 2.0上超越了GPT-4o。作者还分享了类似的真实世界发现:多个廉价模型比单个昂贵模型能发现更多漏洞。
我越是用多个模型,就越觉得“AI共识”是个陷阱——分歧才是唯一值得关注的部分
一篇反思文章,认为在多模型设置中,共识输出的价值低于分歧,分歧揭示了问题中真正存在争议的部分。文章质疑共识是否应该是目标,以及如何区分有建设性的分歧与无意义的噪音。
关键投票盲点:聚合独立性指标忽略了验证真正有助益的场景
本预印本对LLM评审团的聚合独立性指标提出质疑,表明验证信号仅在关键的“一票之差”查询上提升准确率,并提出一种按票数差距分层的调用缩减规则。
@no_stp_on_snek: 如果你构建 multi-agent 或 mixture-of-agents 系统,请阅读 @dangerm00se 的文章。让我印象深刻的一个发现:甚至…
一位用户强调了 Hugh Madden 关于 multi-agent 系统的文章中的一个发现:即使是强大的仲裁者(GPT-5.5),如果先看到较弱代理的输出,也会产生偏差,从约 98% 的单独准确率下降到 7/9。
@johnschulman2:有趣的是,这些模型在网络评估中会陷入一种偏执狂般的暴怒状态。我想知道我们是否正在目睹『分块后训练』的实际效果……
约翰·舒尔曼的一条推文强调了论文《分块后训练》(Chunky Post-Training),该论文认为多样化的后训练数据集会导致模型学习到虚假相关性,从而引发非预期行为,例如拒绝以特定格式呈现的真实事实。论文引入了SURF和TURF来揭示并追踪前沿模型中的这些泛化失败。