optimal-stopping

标签

Cards List
#optimal-stopping

何时寻求帮助:分层LLM代理中的贝叶斯自升级

arXiv cs.LG · 3天前 缓存

本文介绍了一种贝叶斯框架,用于分层LLM代理在推理过程中决定何时升级到更强的模型,将其表述为一个最优停止问题,并提供了性能的理论保证。

0 人收藏 0 人点赞
#optimal-stopping

LLM-OSDA:多轮LLM对话中原生广告的最优停止动态拍卖

arXiv cs.CL · 2026-08-04 缓存

本文提出了LLM-OSDA,一种用于多轮LLM对话中原生广告的动态点击付费拍卖机制,融合了贝尔曼最优停止、获胜者分配和包络定价。实验表明,与固定时机基线相比,净收入提高了11%,同时保持了用户留存率。

0 人收藏 0 人点赞
#optimal-stopping

早期判决,更优预算:面向计算高效RLVR的顺序自适应rollout分配

arXiv cs.LG · 2026-07-30 缓存

本文提出SARA,一种面向RLVR的顺序自适应rollout分配方法,该方法提前放弃饱和组并重新分配预算,相比动态采样,在rollout数量减少22%的情况下达到相当精度,若与之结合则可节省高达67%。

0 人收藏 0 人点赞
#optimal-stopping

CC-AOS:面向有限时限最优停止的代价与时限条件摊销反向归纳

arXiv cs.LG · 2026-07-28 缓存

本文提出CC-AOS,一种面向有限时限最优停止问题的结构化摊销求解器,可在无需重新训练的情况下处理变化的代价与时限。该方法将理论特性融入模型架构,并在基准任务上展示了改进的性能。

0 人收藏 0 人点赞
#optimal-stopping

流式系统中事件触发大语言模型调用的不确定性感知序贯决策规则

arXiv cs.LG · 2026-07-16 缓存

本文将在流式推理系统中何时调用大语言模型的问题形式化为基于风险的序贯停止问题。文中证明了理论保证,并在涡扇退化数据上对框架进行了实证验证。

0 人收藏 0 人点赞
#optimal-stopping

通过深度强化学习的连续时间最优停止

arXiv cs.LG · 2026-06-17 缓存

本文介绍了CARLOS,一种深度强化学习算法,它利用聚合深度神经网络学习美式期权的连续时间最优停止规则,有效缩小了百慕大与美国期权之间的价值差距,并具有较高的计算效率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈