training-technique

标签

Cards List
#training-technique

@maximelabonne: 新的训练技术来减少 doom loops!我们将其应用于 LFM2.5-2.6B (SFT checkpoint) 和 Qwen3.5-4B。通过减少 doom…

X AI KOLs Following · 2026-07-07 缓存

Liquid AI 发布了 Antidoom,一种用于减少推理模型中 doom loops 的开源方法,应用于 LFM2.5-2.6B 和 Qwen3.5-4B,显著降低了 doom-loop 率并提高了评估分数。

0 人收藏 0 人点赞
#training-technique

@JongwonPar9958: GLM-5.2 有一个巧妙的反奖励作弊技巧。他们不惩罚模型,而是检测可疑的工具调用,阻止…

X AI KOLs Timeline · 2026-06-19 缓存

GLM-5.2 使用一种技术来对抗奖励作弊,即通过检测并阻止可疑的工具调用,而不是惩罚模型,从而避免其他方法中常见的混淆问题。

0 人收藏 0 人点赞
#training-technique

@charles_irl: 我的直觉是,要解决由非确定性与非结合性引起的浮点数数值问题,我们需要跳出确定性思维框架。

X AI KOLs Following · 2026-05-22 缓存

这条推文讨论了通过引入“实现噪声”来训练模型,以提高模型对由非确定性和非结合性引起的浮点数数值问题的鲁棒性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈