标签
本文提出了一种通过结合静态和在线校正器来控制下行风险以改进冻结预测器的方法,在基准测试中展示了高达11.5%的增益,并在电力负荷预测中减少了误差。
本文提出了随机通道重演 (RPR) 以约束在线持续学习中的重演间隙,展示了在像ER-ACE这样的经验回放方法中,其准确性优于独立类别平衡检索。
本文介绍了轻量级排序头框架,通过启用动态任务注入,无需重新训练骨干模型,来加速生产推荐系统中的多任务实验,从而在YouTube规模下将迭代周期从数周缩短至数天。
TensorTonic是一个通过编码实践学习机器学习的在线平台,该帖子以解释RBF核函数开头。
本文改进了随机适当在线学习的最优期望错误界,表明其为 O(L(H) log T),这在通用常数范围内对于最坏情况类别是最优的。
本文介绍了RAVEL,一个用于交互式人物重识别的检索感知在线强化学习框架,该框架基于检索反馈优化问题选择,以提高多个交互轮次中的性能。
本文介绍 HACK GPs,这是一种使用专家建议在线学习的方法,用于高斯过程中的核选择,增强在序贯决策任务(如贝叶斯优化和主动学习)中的鲁棒性。
本文引入自由推理维度,这是一个在元强化学习假设混合下,用于零碰撞导航的组合复杂性度量,并证明了其与VC维度及泛化界的关系。
本文介绍了MASA方法,该方法使用冻结的多模态大型语言模型,通过提供结构化语义描述来打破野外测试时适应中的自指循环,实现更可靠的适应。
本文提出了一种用于图神经网络的变分贝叶斯最后层方法,以在分布偏移下进行在线节点分类,与基线相比,在准确性和不确定性校准方面表现优异。
ReCAST 提出了一种在扩散模型微调中实现按奖励、时间步依赖的信用分配方法,将用户偏好与时间分配分离,以提升对齐性和信息价值。
一份精选的10门免费在线内容创作课程列表,涵盖内容营销、博客写作和货币化等主题,由HubSpot和Alison等平台提供。
Microsoft Research 推出了 FrogNano,这是一个40亿参数的编码代理,完全通过强化学习进行训练,并使用在线任务合成,实现了有竞争力的性能,无需从更大模型中蒸馏。
本文提出算法,用于在有限反馈的在线环境中,自适应地将提示路由至LLM专家。该问题被形式化为多臂赌博机问题,旨在最小化遗憾并最大化响应质量。
HyperTrace是一个用于在线LLM个性化的免训练框架,它使用可解释的自然语言假设来追踪潜在用户偏好,从而提升响应对齐性和一致性。
本文将提示到大语言模型专家的自适应路由建模为具有有限反馈的上下文赌博机问题,提出实现次线性遗憾的算法,并展示高效学习高质量路由策略的能力。
一条推文推荐了LabEx,这是一个在线平台,提供实践学习技能如Linux、Docker和网络安全,具有交互式环境和中文支持。