标签
本文讨论软件系统在规模增长时因资源饱和而失效的现象,类比生物系统的极限,并介绍物理资源(CPU、内存、磁盘、网络)饱和和虚拟限制对系统可靠性的影响。
本文将从认知科学中提出的QQ等式发展为针对大型语言模型(LLM)的审计标准,刻画了理论上的机制类别,并在一个开源权重的指令微调模型上进行了实证测试,结果发现饱和(近确定性响应)阻碍了分布级审计。
一条推文指出基准测试很快就会饱和,并以模型 GPT-5.6 Sol Pro 为例,该模型在 prinzbench 上获得了 91/99 的分数,还有两个问题未解决。
本文分析了混合精度神经网络中量化损失的结构,表明饱和使每层损失可加,并提出了一种覆盖模型,该模型用少量参数预测配置损失,在大规模模型上得到验证。