管理虚拟实验室规划中LLM生成程序性知识的不确定性
摘要
本文介绍了一个原型框架,用于管理虚拟实验室规划中LLM生成的程序性知识的不确定性,通过使用结构化领域表示来修复不确定的程序步骤。
arXiv:2605.26333v1 公告类型:新
摘要:教育虚拟实验室可以使实验培训更具可扩展性、适应性和可访问性,尤其是当学生有限制地使用物理实验室设施时。然而,编写新的模拟实验室程序仍然成本高昂:教育工作者必须描述新设备,定义仪器和材料如何相互作用,并指定可在虚拟环境中执行或评估的有效程序流程。大型语言模型可以通过生成详细的实验程序来协助这一编写过程,但其输出不应被视为可直接执行的计划。它们可能会遗漏必要的操作,步骤顺序错误,或者产生逻辑上不正确或与实验室设备不兼容的指令。本文介绍了一个原型框架,用于管理虚拟实验室规划中LLM生成的程序性知识的不确定性。该框架旨在减少程序性不确定性,通过使用结构化领域表示和不确定的LLM生成的状态转换样本,提取候选程序规则,将其转换为显式且可检查的约束,并使用它们来修复不确定的程序步骤。虽然动机领域涉及教育虚拟实验室,但底层问题更为普遍:管理结构化交互环境中动作规划的不确定程序性知识。我们在一个虚拟实验室领域中说明了这种方法,该领域涉及实验室仪器、容器、工具和物料转移操作。
查看缓存全文
缓存时间: 2026/05/27 09:04
# 管理虚拟实验室规划中大语言模型生成程序性知识的不确定性 来源:https://arxiv.org/abs/2605.26333 查看PDF (https://arxiv.org/pdf/2605.26333) > **摘要**:教育类虚拟实验室可以使实验培训更具可扩展性、适应性和可访问性,尤其是在学生接触物理实验室设施机会有限的情况下。然而,编写新的模拟实验室程序仍然成本高昂:教育工作者必须描述新设备,定义仪器与材料的交互方式,并指定可在虚拟环境中执行或评估的有效程序流程。大语言模型可以通过生成详细的实验程序来辅助这一编写过程,但其输出不应被视为可直接执行的计划。它们可能遗漏必要操作、步骤排列顺序错误,或产生逻辑不正确、与实验室设备不兼容的指令。本文提出了一种原型框架,用于管理虚拟实验室规划中大语言模型生成的程序性知识的不确定性。该框架旨在通过使用结构化领域表示和不确定的大语言模型生成的状态转换样本,提取候选程序规则,将其转化为明确且可检查的约束,并用这些约束修复不确定的程序步骤,从而降低程序不确定性。尽管所涉及的领域是教育类虚拟实验室,但底层问题更为普遍:即在结构化交互环境中管理用于行动规划的不确定程序性知识。我们通过一个包含实验室仪器、容器、工具和物料转移操作的虚拟实验室领域来演示该方法。 ## 提交历史 来自:Polychronis Karpodinis \[查看邮件 (https://arxiv.org/show-email/3749a077/2605.26333)\] **\[v1\]**2026年5月25日星期一 21:12:47 UTC (486 KB)
相似文章
无知还是无能?为LLM智能体构建知识门控可验证任务
本文提出了一种知识门控任务构建协议,用于明确测试LLM智能体对隐藏知识的依赖性。校准任务验证表明,在无法访问私有约定时,模型性能会显著下降。
从序列到结构:LLM智能体的关系不确定性传播
本文提出RUPA,一个框架,将LLM智能体的执行建模为依赖图以传播不确定性,改进长轨迹中的故障检测和置信度估计。
判断、检索或放弃:具有可证明风险保证的不确定性防护LLM判断
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。
迈向可靠且鲁棒的LLM规划:符号反馈驱动的迭代自我改进框架
本文提出了一种符号反馈驱动的迭代自我改进框架,以提高大语言模型在长周期规划任务中的鲁棒性和可靠性。该方法利用自然语言提示、符号验证器和计划识别器来增强可行性与正确性。
当规划正确执行却失败时:论基于LLM的多智能体系统的认知校准
本文识别了基于LLM的多智能体系统中的一种失败模式,即由于智能体错误判断自身知识(认知校准不当)而导致规划失败,并提出EPC-AW工作流,通过信息一致性和认知状态细化将系统级成功率提升9.75%。