标签
Liquid AI 发布了 Antidoom,一种用于减少推理模型中 doom loops 的开源方法,应用于 LFM2.5-2.6B 和 Qwen3.5-4B,显著降低了 doom-loop 率并提高了评估分数。
GLM-5.2 使用一种技术来对抗奖励作弊,即通过检测并阻止可疑的工具调用,而不是惩罚模型,从而避免其他方法中常见的混淆问题。
这条推文讨论了通过引入“实现噪声”来训练模型,以提高模型对由非确定性和非结合性引起的浮点数数值问题的鲁棒性。