@latkins: Fern 是最棒的之一
摘要
Fern 宣布了一种新的正则化技术,解决了 SolidGoldMagikarp 稳定性问题,详情将在后续帖子中说明。
Fern 是最棒的之一
查看缓存全文
缓存时间: 2026/05/26 21:14
Fern 是最出色的之一
Fern (@hi_tysam): 大约两年多前,我解决了 SolidGoldMagikarp 稳定性问题。
今天,我将这项工作的成果作为一项新的训练正则化技术发布。
更多细节如下。
相似文章
@lqiao: https://x.com/lqiao/status/2070026145895256314
Fireworks 正在提供一种针对 GLM 5.2 的强化学习训练的托管服务,该服务通过批次不变性和零 KLD 对齐确保训练和推理之间的数值一致性,以前只有顶尖前沿实验室才能使用。这使得任何人都可以定制并超越前沿质量。
@levidiamode: GPU编程第157/365天:另一个对我非常有帮助的FlashAttention4资源是@charles_irl的演讲…
一个每日GPU编程帖子重点介绍了Charles_irl的演讲,该演讲在论文发布前逆向工程了FlashAttention4代码,并赞扬了Modal团队对代码的深入剖析和对前向传播的合理推断。
poolside/Laguna-S-2.1-GGUF
Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。
FragileFlow:通过频谱控制正确但脆弱的预测以增强基础模型的鲁棒性
本文介绍了 FragileFlow,这是一种插件式正则化器,通过频谱分析和 PAC-Bayes 界来控制“正确但脆弱”的预测,从而提高 LLM 和 VLM 的鲁棒性。
在Fable-5编码轨迹上微调了LiquidAI的LFM2.5-230M模型——结果比预期的要好
在Fable-5编码轨迹上微调了LiquidAI的LFM2.5-230M模型,发现结果比预期的要好。