最新

全部文章,按抓取时间从新到旧排列。

Cards List

MileGPO:基于局部证据的里程碑推理用于长期LLM代理的图策略优化

arXiv cs.LG · 12小时前 缓存

MileGPO提出了一种用于长期LLM代理信用分配的方法,该方法利用基于局部证据的里程碑推理,并在ALFWorld和WebShop基准测试中实现了最先进的性能。

0 人收藏 0 人点赞

基于Flow Matching的表格数据无监督异常检测

arXiv cs.LG · 12小时前 缓存

本文研究了使用flow matching在表格数据上的无监督异常检测,重点关注受污染的训练集,并比较不同的评分方法以增强鲁棒性。

0 人收藏 0 人点赞

AdamW中批次扰动的有限时域输入-输出动力学

arXiv cs.LG · 12小时前 缓存

本文通过将AdamW建模为有限时域输入-状态-输出系统,分析了批次扰动的延迟效应,揭示了优化器状态如何影响训练动力学。

0 人收藏 0 人点赞

无真值的信用分配:基于执行重放审计LLM代理中的步骤级信用分配

arXiv cs.LG · 12小时前 缓存

本文使用执行重放的因果真值来审计LLM代理中的步骤级信用分配,发现常见的信用信号在识别因果重要步骤方面未能优于随机水平,这对训练方法具有启示意义。

0 人收藏 0 人点赞

截断差项,提升优项:基于排名分类的BoN式蒸馏

arXiv cs.LG · 12小时前 缓存

论文提出了TUP,一种基于排名分类的BoN式蒸馏方法,通过截断低排名的完成项并提升高排名的项,以改善对齐效率和性能。

0 人收藏 0 人点赞

RecPFN:基于上下文的推荐系统的先验拟合网络

arXiv cs.LG · 12小时前 缓存

RecPFN引入了一种先验拟合网络,用于序列推荐中的上下文学习,通过在合成点击流数据上预训练,在多个基准测试中实现了先进的零样本性能。

0 人收藏 0 人点赞

用于鲁棒时间序列水印的局部令牌化生成模型

arXiv cs.LG · 12小时前 缓存

本文介绍了一种用于多元时间序列数据鲁棒水印的局部令牌化生成模型,通过使用有界时间邻域进行令牌恢复来解决后编辑攻击下的可靠性问题。

0 人收藏 0 人点赞

SAGE-XGBoost: 空间增强图嵌入——数据稀缺条件下的自然灾害易发性映射机器学习框架

arXiv cs.LG · 12小时前 缓存

SAGE-XGBoost 是一个机器学习框架,它使用空间增强图嵌入和数据增强来提升在数据稀缺条件下的自然灾害易发性映射,展示了优于传统模型的性能。

0 人收藏 0 人点赞

FleetSieve:面向SLO感知LLM舰队配置的决策关键型分析方法

arXiv cs.LG · 12小时前 缓存

FleetSieve提出了一种针对SLO感知LLM舰队配置的决策关键型分析方法,通过精简测量来优化资源分配,实现了相比均匀分析更高的效率。

0 人收藏 0 人点赞

用于高Péclet入口输运DeepONet代理模型的有理增强Chebyshev主干基

arXiv cs.LG · 12小时前 缓存

本文介绍了一种用于DeepONet代理模型的有理增强Chebyshev主干,提高了模拟具有薄边界层的高Péclet输运问题的准确性。

0 人收藏 0 人点赞

DeltaML-Bench: 评估现实研究代码库上的机器学习智能体

arXiv cs.LG · 12小时前 缓存

介绍了DeltaML-Bench,一个用于评估机器学习智能体在现实研究代码库上的基准测试,展示了ARG脚手架相比标准方法显著提高了成功率。

0 人收藏 0 人点赞

用于折扣最小二乘的时间一致自归一化集中不等式:极限与修正

arXiv cs.LG · 12小时前 缓存

本文指出了一个广泛使用的时间一致自归一化集中不等式在非平稳多臂赌博机问题中用于折扣最小二乘时的错误,提供了反例和下界,并给出了修正后的不等式。

0 人收藏 0 人点赞

互补而非累积:物理信息神经网络在纳维-斯托克斯涡脱落中的交互效应

arXiv cs.LG · 12小时前 缓存

本研究系统评估了用于流体动力学的物理信息神经网络技术,表明将周期性激活与因果加权相结合可提高Navier-Stokes涡脱落基准测试的性能,而进一步添加则因非线性交互作用而导致性能下降。

0 人收藏 0 人点赞

单循环熵正则化自然演员-评论家算法的非正则化收敛

arXiv cs.LG · 12小时前 缓存

本文分析了一种单循环、熵正则化的自然演员-评论家算法,并在随机和确定性环境下,针对线性函数逼近,证明了非正则化目标的加速收敛率。

0 人收藏 0 人点赞

用于复数神经网络下降及其保证的Kähler景观,包括对Calabi-Yau流形的搜寻与消除

arXiv cs.LG · 12小时前 缓存

本文使用Kähler几何和信息流形探讨复数神经网络中的优化景观,为下降路径提供理论保证,并分析Calabi-Yau度量的影响。

0 人收藏 0 人点赞

用于短期AECOPD风险预测的两阶段时间感知Transformer

arXiv cs.LG · 12小时前 缓存

本文介绍了一种两阶段Transformer框架,用于利用家用呼吸机原始波形数据预测COPD急性加重的风险和时机,并展示了相比基线模型的性能提升。

0 人收藏 0 人点赞

DraftFM:适用于《万智牌》初始轮抽的基础模型

arXiv cs.LG · 12小时前 缓存

DraftFM是一个用于预测《万智牌》轮抽选择的基础模型,通过利用卡牌特征和行为数据,实现对新系列的准确初始轮抽。它在保留扩展包上展示了强劲性能,并成功预测了一个未发布的系列。

0 人收藏 0 人点赞

连续对抗性MeanFlow迁移

arXiv cs.LG · 12小时前 缓存

本文提出MeanFlow-Transfer(MF-T)和连续对抗性MeanFlow(CAMF),以统一预训练扩散和流动模型的适配和加速,实现数据有限新领域的高质量少步生成。

0 人收藏 0 人点赞

终身学习的双重思考:神经模型中半球冗余与专业化的探索

arXiv cs.LG · 12小时前 缓存

本文提出了一种新型神经架构4MAS,受生物双边性和记忆巩固启发,旨在解决终身学习中的灾难性遗忘问题,在基准数据集上取得了具有竞争力的结果。

0 人收藏 0 人点赞

混合量子预测模型学习几何的实证表征

arXiv cs.LG · 12小时前 缓存

本文实证性地表征了混合量子预测模型的学习几何,通过使用 Neural Tangent Kernel 动态和其他指标将其与经典基线进行比较,表明相似的泛化能力可以从不同的优化轨迹中涌现。

0 人收藏 0 人点赞
← 上一页
下一页 →
← 返回首页

提交意见反馈