标签
本文审计了LLM集成的五个多样性指标,发现它们与多数投票增益的关联与模型能力高度纠缠,且在控制能力后不稳定。唯一稳健的信号是适度的残差成对共失败关联。
本文研究了将多个LLM的概率估计进行聚合是否会产生群体智慧效应,发现学习型聚合器优于单个模型,并且训练截止期污染是此类评估中普遍存在的混淆因素。