on-policy-learning

标签

Cards List
#on-policy-learning

STAR-OPD: 用于ABSA四元组提取的结构化方面级联感知在线策略奖励蒸馏

arXiv cs.CL · 2026-08-24 缓存

STAR-OPD是一种新颖的在线策略蒸馏方法,用于ABSA四元组提取,它使用集合结构化奖励来纠正学生模型中的结构错误,提高性能并缩小与教师模型之间的差距。

0 人收藏 0 人点赞
#on-policy-learning

加速视觉策略内蒸馏:基于批处理推测性雅可比展开

arXiv cs.LG · 2026-08-20 缓存

本文提出HB-SJD,一种用于视觉策略内蒸馏的批处理推测性雅可比解码方法。该方法通过并行处理多个词元来加速展开生成,在保持生成质量的同时缩短训练时间。

0 人收藏 0 人点赞
#on-policy-learning

尾感知的 Top-$k$ 在策略蒸馏

arXiv cs.LG · 2026-08-18 缓存

本文提出了尾感知的 Top-k On-Policy 蒸馏(TA-OPD),以解决语言模型在 on-policy 蒸馏中尾部概率丢失的问题,从而提高基准测试上的下游准确性。

0 人收藏 0 人点赞
#on-policy-learning

通过在策略自蒸馏缓解LLM评判器中的评分标准干扰

arXiv cs.LG · 2026-08-18 缓存

本文解决了LLM评判器在同时评估多个评分标准时遇到的评分标准干扰问题,并提出了自锚定评分标准对齐(SARA)方法,通过在策略自蒸馏来提高评估一致性。

0 人收藏 0 人点赞
#on-policy-learning

DUET:通过同权重分歧实现禁令合规的双教师在线策略蒸馏

arXiv cs.LG · 2026-08-18 缓存

DUET是一种双教师在线策略蒸馏方法,旨在确保LLM遵守运行时禁令。它通过令牌选择学习,在保持高违规合规性的同时维持模型实用性。

0 人收藏 0 人点赞
#on-policy-learning

自监督视觉在线策略蒸馏

Hugging Face Daily Papers · 2026-08-14 缓存

本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。

0 人收藏 0 人点赞
#on-policy-learning

潜在同策略自蒸馏 (LOPD)

Hugging Face Daily Papers · 2026-08-13 缓存

本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。

0 人收藏 0 人点赞
#on-policy-learning

视觉语言导航中用于语义探索的路径级事后指令

arXiv cs.AI · 2026-07-03 缓存

介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。

0 人收藏 0 人点赞
#on-policy-learning

OPRD:在策略表示蒸馏

Hugging Face Daily Papers · 2026-06-04

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

0 人收藏 0 人点赞
#on-policy-learning

利用推理框架进行训练:面向复杂推理的在策略框架自蒸馏

arXiv cs.CL · 2026-05-12 缓存

本文介绍了在策略框架自蒸馏(OPHSD),该方法通过自蒸馏将推理时框架的能力内化到基础模型中。该方法提高了模型在复杂推理任务上的独立性能,使模型能够在不依赖永久性外部工具的情况下保留推理辅助结构。

0 人收藏 0 人点赞
#on-policy-learning

基于评分细则的在策略蒸馏

Hugging Face Daily Papers · 2026-05-08 缓存

本文提出了 ROPD,一种基于评分细则的在策略蒸馏框架,相比传统的基于 logits 的方法,该框架在样本效率上表现更优。它通过使用结构化的语义评分细则而非教师 logits,实现了黑盒场景下的模型对齐。

0 人收藏 0 人点赞
#on-policy-learning

D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏

Hugging Face Daily Papers · 2026-05-06 缓存

本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。

0 人收藏 0 人点赞
#on-policy-learning

如何微调推理模型?一个教师-学生协作框架用于合成学生一致的SFT数据

Hugging Face Daily Papers · 2026-03-23 缓存

本文介绍了TESSY,一种用于微调推理模型的教师-学生协作框架。该框架通过将生成过程解耦为能力令牌(来自教师)和风格令牌(来自学生),生成符合在线策略的SFT数据,从而解决了使用离线策略教师数据时的灾难性遗忘问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈