clipping

标签

Cards List
#clipping

CertBind:从多模态连接到可认证检索决策

arXiv cs.LG · 2026-08-10 缓存

CertBind 提出了一种多尺度理论,用于冻结多模态编码器连接器的可认证组合,通过回退(fallback)和弃权(abstain)机制实现可认证的检索决策。在共享路径上的评估表明,它能够恢复原生 CLIP 检索性能,同时在旁路分支上保持无损(no-harm)。

0 人收藏 0 人点赞
#clipping

陈旧但稳定:用于稳定异步强化学习的陈旧自适应信任区域

Hugging Face Daily Papers · 2026-07-21 缓存

引入了陈旧自适应信任区域(SAT),通过根据陈旧性自适应控制更新间隔来稳定异步强化学习。在基于Qwen3-30B-A3B-Base的解耦异步强化学习设置上进行了评估,取得了改进的结果。

0 人收藏 0 人点赞
#clipping

超越欧几里得裁剪:通过黎曼等距策略优化克服LLM强化学习中的探索崩溃

Hugging Face Daily Papers · 2026-07-11 缓存

本文揭示了PPO-Clipping使用欧几里得度量导致LLM强化学习中的探索崩溃,并提出了黎曼等距策略优化(RIPO)以确保几何一致的策略更新,在AIME24上比GRPO提升了高达60%。

0 人收藏 0 人点赞
#clipping

UP:打破探索-稳定性困境的无界正非对称优化

arXiv cs.LG · 2026-07-09 缓存

本文提出无界正非对称优化(UP),一种通用的即插即用目标函数,通过使用停止梯度锚定策略,解决了基于强化学习的大语言模型训练中的探索-稳定性困境,允许对正优势使用无裁剪梯度,同时对负优势进行裁剪。

0 人收藏 0 人点赞
#clipping

@johnschulman2: PPO在LLM时代迎来了第二波,原因超出了原始论文的预期——重要性比率目标会修正由数值误差、异步训练和前向传播噪声引起的偏差——而裁剪目标通过一种我们当初发表时未知的机制影响熵(DAPO, https://arxiv.org/abs/2509.26114)

X AI KOLs Following · 2026-06-18 缓存

本文揭示了PPO和GRPO中的裁剪机制在LLM的RLVR中引入了熵偏差:低裁剪增加熵,高裁剪减少熵。作者证明,即使在随机奖励的情况下,标准裁剪也会降低熵,并表明调整低裁剪可以防止熵塌陷并促进探索。

0 人收藏 0 人点赞
#clipping

MuCon: Clipped Muon Updates for LLM Training

arXiv cs.LG · 2026-05-27 缓存

本文介绍了MuCon,一种用于大语言模型训练的裁剪Muon优化器,它应用奇异值裁剪而非完全极化,保留较小的奇异值而仅裁剪最大的奇异值。它探索了避免全SVD的近似方法,包括极坐标/绝对值公式和有理牛顿滤波器,并指出了阈值附近的数值挑战。

0 人收藏 0 人点赞
#clipping

剪辑如何吞噬互联网

The Verge · 2026-05-26 缓存

The Vergecast 本期节目探讨了社交媒体信息流如何被剪辑内容和算法蛮力所主导,同时还评测了新款 Fitbit Air 健身追踪器,并讨论了智能眼镜这一产品类别。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈