标签
本文介绍了一种贝叶斯框架,用于分层LLM代理在推理过程中决定何时升级到更强的模型,将其表述为一个最优停止问题,并提供了性能的理论保证。
本文提出了LLM-OSDA,一种用于多轮LLM对话中原生广告的动态点击付费拍卖机制,融合了贝尔曼最优停止、获胜者分配和包络定价。实验表明,与固定时机基线相比,净收入提高了11%,同时保持了用户留存率。
本文提出SARA,一种面向RLVR的顺序自适应rollout分配方法,该方法提前放弃饱和组并重新分配预算,相比动态采样,在rollout数量减少22%的情况下达到相当精度,若与之结合则可节省高达67%。
本文提出CC-AOS,一种面向有限时限最优停止问题的结构化摊销求解器,可在无需重新训练的情况下处理变化的代价与时限。该方法将理论特性融入模型架构,并在基准任务上展示了改进的性能。
本文将在流式推理系统中何时调用大语言模型的问题形式化为基于风险的序贯停止问题。文中证明了理论保证,并在涡扇退化数据上对框架进行了实证验证。
本文介绍了CARLOS,一种深度强化学习算法,它利用聚合深度神经网络学习美式期权的连续时间最优停止规则,有效缩小了百慕大与美国期权之间的价值差距,并具有较高的计算效率。