标签
本文介绍了使用归一化压缩距离作为衡量语言模型的生成过程多样性的方法,证明其在预测跨基准关联故障方面优于语义相似性,并对多模型系统的安全性具有启示意义。
本文揭示了多模型LLM系统的一个基本约束:准确率受制于所有模型在同一查询上同时出错的比率。在67个前沿模型中,常见指标显著低估了全错率,从而限制了投票、路由和集成策略的收益。