标签
MIITA是一个内存诱导的推理时自适应框架,专为小语言模型的持续学习设计。它存储修正方向原型,并在推理时应用门控隐藏状态自适应,从而在不更新主干参数的情况下缓解灾难性遗忘。
本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。
本文研究使用监督学习构建一个预言机,用于决定何时在约束规划中应用计算昂贵的 Energetic Reasoning 传播器,展示了高预测准确性,并强调了关键的设计选择。
本文系统表征了线性模型与单量子比特混合态模型在二分类任务中的内在可解释性差异,揭示了量子模型学习的是超椭球而非超平面,并探讨了这一发现对归纳偏置及教学法的启示。
提出了部分裁决的基于设计的监督学习(PA-DSL)方法,该方法利用少量已裁决案例纠正噪声人工标签,从而消除自动化分类器的偏差,在实验中实现了名义覆盖度,并将均方根误差(RMSE)降低了10-17%。
本文整合了监督式政治量表分析的最新进展,探讨联合预测意识形态量表以及分类与回归之间的中间地带是否能提升性能。
本文认为,包括GPT-5在内的数据驱动机器学习系统无法仅通过缩放达到符号级别的逻辑推理,原因在于它们在区分逻辑结构与统计规律方面存在固有局限性。
本文提出了一种监督强化学习(SRL)框架,用于协调分布式能源资源,通过在演示数据上预训练并通过强化学习微调,以提高样本效率和性能。
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
本文采用逐层探测的方法,研究wav2vec 2.0和Whisper如何编码非裔美国人英语中的辅音丛简化现象,发现这两个模型均能区分简化形式和规范形式,并保留了底层塞音的线索。
本文建模了交互式定向广告如何通过可观察的用户交互泄露用户属性信息,并在合成数据上评估了贝叶斯、监督学习及其他攻击方法,同时讨论了作为防御手段的披露控制措施。
本文评估了监督机器学习/深度学习模型和提示大语言模型在自动进行布卢姆分类学试题分类时的跨数据集泛化能力,发现大语言模型在不同教育背景下具有更强的鲁棒性。
本文介绍了FormatMix,一种多格式训练方法,通过将部分训练项扩展为多个等效格式来提升LLM在不同答案格式间的一致性,表明格式多样性是鲁棒性的关键。
Rich Sutton argues that generative AI trained by supervised learning cannot achieve genuine novelty and quality simultaneously, and that true discovery requires a 'vary, evaluate, select' mechanism found in reinforcement learning rather than pure imitation.
本文形式化了监督学习中贝叶斯充分表示(Bayes-sufficient representations)的概念,定义了在给定损失函数下,一个表示何时恰好保留了贝叶斯最优预测所需的信息。文章引入了贝叶斯商(Bayes quotient)作为依赖于损失函数的典范对象,并将该框架与性质激发(property elicitation)相关联,通过实验阐明了充分性、最小性与冗余保留信息之间的区别。
本文提出了 Q-align DT 框架,该框架将 return-to-go 与 Q 值对齐,以提高离线强化学习中的可控性和性能,在 D4RL 基准上取得了优异的结果。
本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。
本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。
本文研究浅层神经网络代理是否能够通过强化学习掌握纸牌游戏Schnapsen,超越监督模仿基线,并在一项与基于强搜索的对手的对比中取得有竞争力的结果。
本文认为,探索对于所有学习系统(包括监督学习)都是至关重要的,并提出了一种通用探索框架,以推动开放式学习走向通用智能。