supervised-learning

标签

Cards List
#supervised-learning

通过多格式训练提升语言模型的跨格式鲁棒性

arXiv cs.CL ↗ · 2026-06-11 缓存

本文介绍了FormatMix,一种多格式训练方法,通过将部分训练项扩展为多个等效格式来提升LLM在不同答案格式间的一致性,表明格式多样性是鲁棒性的关键。

0 人收藏 0 人点赞
#supervised-learning

Rich Sutton on AI creativity and discovery

Hacker News Top ↗ · 2026-06-10 缓存

Rich Sutton argues that generative AI trained by supervised learning cannot achieve genuine novelty and quality simultaneously, and that true discovery requires a 'vary, evaluate, select' mechanism found in reinforcement learning rather than pure imitation.

0 人收藏 0 人点赞
#supervised-learning

# 监督学习中的贝叶斯充分表示

arXiv cs.LG ↗ · 2026-06-04 缓存

本文形式化了监督学习中贝叶斯充分表示(Bayes-sufficient representations)的概念,定义了在给定损失函数下,一个表示何时恰好保留了贝叶斯最优预测所需的信息。文章引入了贝叶斯商(Bayes quotient)作为依赖于损失函数的典范对象,并将该框架与性质激发(property elicitation)相关联,通过实验阐明了充分性、最小性与冗余保留信息之间的区别。

0 人收藏 0 人点赞
#supervised-learning

Return-to-Go 不仅仅是数字:用于返回条件监督学习的 Q 引导对齐

arXiv cs.LG ↗ · 2026-05-29 缓存

本文提出了 Q-align DT 框架,该框架将 return-to-go 与 Q 值对齐,以提高离线强化学习中的可控性和性能,在 D4RL 基准上取得了优异的结果。

0 人收藏 0 人点赞
#supervised-learning

评估基础模型在时间序列预测中的运行可行性

arXiv cs.LG ↗ · 2026-05-26 缓存

本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。

0 人收藏 0 人点赞
#supervised-learning

目标条件监督学习用于LLM微调

arXiv cs.LG ↗ · 2026-05-19 缓存

本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。

0 人收藏 0 人点赞
#supervised-learning

从模仿到交互:使用浅层强化学习掌握Schnapsen游戏

arXiv cs.AI ↗ · 2026-05-19 缓存

本文研究浅层神经网络代理是否能够通过强化学习掌握纸牌游戏Schnapsen,超越监督模仿基线,并在一项与基于强搜索的对手的对比中取得有竞争力的结果。

0 人收藏 0 人点赞
#supervised-learning

@jennyzhangzt: 通用智能需要重新思考探索

X AI KOLs Timeline ↗ · 2026-05-16 缓存

本文认为,探索对于所有学习系统(包括监督学习)都是至关重要的,并提出了一种通用探索框架,以推动开放式学习走向通用智能。

0 人收藏 0 人点赞
#supervised-learning

加权对比学习的统一几何框架

arXiv cs.LG ↗ · 2026-05-15 缓存

本文提出了一个统一的几何框架,证明加权InfoNCE目标可以解释为距离几何问题,从而精确刻画了有监督和弱监督对比学习方法的最优嵌入,并揭示了这些嵌入何时在几何上可实现、退化或不一致。

0 人收藏 0 人点赞
#supervised-learning

UniSD:面向大型语言模型的统一自蒸馏框架

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

本文提出了 UniSD,这是一种用于适应大型语言模型的统一自蒸馏框架,整合了监督可靠性、表征对齐和训练稳定性的机制。实验结果表明,UniSD 在多个基准测试中均优于基础模型和现有基线方法。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈