标签
本文提出 CaRE,一种用于掩码扩散语言模型的计算感知评估协议,它标准化了步数、指标和随机性。该协议表明,先前的比较混淆了算法改进与评估伪影,并揭示温度解释了 MAUVE 的大部分方差,而计算匹配的比较则颠覆了已发表的排名。
PlaceMem提出了一种面向终身智能体的计算感知记忆平面,使用版本化的记忆胶囊来统一语义内容和可复用的运行时状态,从而实现可感知纠错的复用,避免冗余计算。
本文提出了一种针对LLM对抗鲁棒性的计算感知评估框架,提出了基于FLOPs的风险-计算曲线和度量指标,以更好地评估攻击成本,发现对齐训练具有非单调效应,且计算成本因模型和危害类别而异。