标签
Not Diamond 发布了一种模型路由的方法论,该方法论在将代理成本降低 20-80% 的同时,实现了 Opus 级别的质量,使用序列决策方法有效处理长时间运行的编码代理。
CDPR是一种基于反事实优势的信用分配方法,用于通过强化学习训练成本感知的序列医疗诊断模型,在提高诊断准确性的同时减少检查成本和数量。
GenMatch 是一个用于网约车微视图订单调度的端到端生成匹配框架,解决了批量编码和效用学习等挑战,以提高调度质量,并在实际测试中展示了其有效性。
arXiv 上一篇新论文介绍了名为 LLMRouter 的开源库,包含超过 16 种路由器实现和基准测试 xRouteBench,表明学习型路由器可比固定模型基线提升 14.6%。
本文将在流式推理系统中何时调用大语言模型的问题形式化为基于风险的序贯停止问题。文中证明了理论保证,并在涡扇退化数据上对框架进行了实证验证。
提出了一种不确定性感知的地质导向框架,该框架将用于概率地下解释的粒子滤波与用于序贯决策的强化学习相结合,并在工业模拟器上进行了评估。
本文研究在序贯决策问题中,规划者何时以及如何用真实实验补充预训练模拟器,提出Fisher-SEP以最小化目标策略值的后验方差。