一百万人,一百万个人工智能代理,三个基础模型。这能构成多元化的审议吗?——又如何衡量?

Reddit r/artificial 新闻

摘要

针对仅用三个基础模型支撑数百万个人工智能代理是否能产生真正多元化的审议进行批判性反思,认为模型间的相关误差可能造成虚假的一致意见,并寻求从集成学习中得出的可操作指标来衡量真正的人类代表性多样性。

假设每个人都有一个了解他们的个人AI,这些代理在决策到达人类之前代表他们进行协商。有人向我提出了这个反对意见,我一直无法回答:三个提供商对一个人来说可能感觉多元,但对于涉及一百万人的决策来说,远远不够多元。对我来说,比较三个模型是真正的多元主义——我看到了真正不同的答案。但在人口规模上,重要的不是输出是否看起来不同。而是错误是否独立。如果一百万个代理共享少数几个基础模型,一个系统性的盲点不会表现为需要解决的分歧。它表现为一致同意。审议看起来会在它失败的那一刻完美运行。供应商数量显然是个错误的指标。“三家公司”告诉你他们的失败模式是否相关——他们在重叠的语料库上训练,使用相似的架构,并且越来越多地相互蒸馏。问题:你究竟会测量什么来区分“所代表人类的多样性”和“底层模型的多样性”?我追求的是可操作的东西——一个可以在实际审议中计算并根据其采取行动的量。对我有用的是:来自集成学习或预测领域的指标,它们可以迁移到这里,以及它们需要的输入;关于聚合中相关误差的研究(我怀疑这是某个我不知道的领域中已解决的问题);一个论证,证明我所做的区分是混乱的——即“代表的人类多样性”在原则上与模型多样性不可分离;一个阈值:怎样的去相关才足够去相关,以及如何决定?无用的是:“只要用更多模型。”这正是一个答案,其充分性我正在质疑。
查看原文

相似文章

观察AI模型彼此意见分歧出乎意料地有用

Reddit r/AI_Agents

本文讨论了比较多个AI模型的回答如何揭示推理中的漏洞和不确定性,并提出轻量级的多模型比较作为一种有用的验证层,在复杂的智能体编排之前进行应用。

我们衡量了AI能力在模型规模扩大时如何相互作用。在3.5B以下,推理与真实性相互对抗。超过这个规模,它们协同合作。这种转变是可工程化的。(2篇论文 + 交互式仪表盘 + 7个可证伪预测)

Reddit r/artificial

研究人员发现了一个关键规模(约35亿参数),在该规模下,AI模型的推理与真实性之间的权衡从对抗转向合作。他们提供了一个框架、交互式仪表板以及开源引导工具,用于识别并纠正小规模下出现的错误输出。