标签
本调查提出了一种使用大语言模型的主动服务代理统一决策框架,将问题表述为部分可观察的序列决策过程,并组织了关于主动性、时机和安全性的方法和评估指标。
本文介绍了RO-PnR,一个决策框架,用于在多轮健康错误信息干预中学习何时提出澄清问题与提供纠正,以更少的轮次实现更高的成本调整效用。
该论文评估了零样本LLM何时能在生产环境中取代微调NLU分类器进行意图检测,突出了LLM在超出范围检测、ASR鲁棒性和动态模式方面的优势,并为实践者提供了决策框架。
文章概述了一个三步决策梯度,用于在AI客户项目中选择改进提示词、检索增强生成或微调,并强调了评估集的关键作用。
文章提出了一个框架,用于根据两个因素决定给予AI代理多少自主权:检查输出的难易度和撤销错误的难易度。它介绍了四种委托级别,从代理作为助手到完全自动驾驶模式,并用决策树进行了说明。
本文介绍了YUKTI框架,该框架通过使用不确定性类型化的命题图、带有遗憾边界的假设鲁棒帕累托前沿以及多阶段优化交接,将自然语言决策情境转化为鲁棒、可验证的决策。在合成数据集和真实数据集上的验证表明,与朴素点解方法相比,它显著降低了遗憾,并揭示了语言模型推理的局限性。