无知还是无能?为LLM智能体构建知识门控可验证任务
摘要
本文提出了一种知识门控任务构建协议,用于明确测试LLM智能体对隐藏知识的依赖性。校准任务验证表明,在无法访问私有约定时,模型性能会显著下降。
查看缓存全文
缓存时间: 2026/09/03 11:51
论文页面 - 无知还是无能?为LLM智能体构建知识门控的可验证任务
来源:https://huggingface.co/papers/2608.30322
摘要
一种协议将任务指令与私有约定构件分离,以显式测试智能体对隐藏知识的依赖性,并通过校准任务验证了在无权限访问时性能接近于零。
专业智能体任务通常依赖于公共语料库中缺失的约定,然而基准测试很少控制智能体是否能够访问这些约定。我们引入了知识门控任务构建 (https://huggingface.co/papers?q=knowledge-gated%20task-construction) 协议,该协议将任务指令与一个包含私有约定、参考表和实用操作符的紧凑构件分离。构建时溯源 (https://huggingface.co/papers?q=provenance)、在提供与扣留构件条件下字节完全一致的任务指令、泄露审计 (https://huggingface.co/papers?q=leak%20audits) 和可执行见证 (https://huggingface.co/papers?q=executable%20witnesses) 使得对构件的依赖性变得明确且可测试。在十五个校准任务 (https://huggingface.co/papers?q=calibration%20tasks) 中,一个前沿智能体 (https://huggingface.co/papers?q=frontier%20agent) 配置在有构件时通过率为68.0%,无构件时为0%;在一个任务上,一个看似合理但错误的构件在五次试验中也产生0%的结果。确定性求解器 (https://huggingface.co/papers?q=Deterministic%20solvers) 和规则语料库 (https://huggingface.co/papers?q=rule%20corpora) 为结构化任务提供了精确的 ground truth,而命名标准级评分标准 (https://huggingface.co/papers?q=criterion-level%20rubrics) 支持无法由单一可执行预言机检查的输出。一个相对配置的校准筛选保留了七个满足我们五次实证知识门控筛选的任务。这些实验验证了构建协议的行为;它们并未证明保留的任务能改进训练后性能。我们在 https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction 公开了部分任务套件和支持工具。
查看arXiv页面 (https://arxiv.org/abs/2608.30322)查看PDF (https://arxiv.org/pdf/2608.30322)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.30322)
在你的智能体中获取这篇论文:
hf papers read 2608\.30322
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接到本文
在模型README.md中引用 arxiv.org/abs/2608.30322 以从本页面链接它。
引用本文的数据集0
没有数据集链接到本文
在数据集README.md中引用 arxiv.org/abs/2608.30322 以从本页面链接它。
引用本文的Space0
没有Space链接到本文
在Space README.md中引用 arxiv.org/abs/2608.30322 以从本页面链接它。
包含本文的合集0
没有合集包含本文
将本文添加到合集 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
在冲突激励下LLM智能体中知识验证的涌现欺骗
本文介绍了KnownLieBench,这是一个通过验证知识来评估在冲突激励下LLM智能体中涌现欺骗的基准。
LLM代理中的忠实不确定性:实践中校准与效用权衡
一位从业者讨论了LLM代理中的校准与效用权衡,分享了基于验证器的流水线经验,该流水线将幻觉工具调用减少了约60%,但引入了延迟成本并丢失了简单的正确答案。
LLM的未来发展方向
文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。
@dair_ai: 一个LLM代理真的能构建它无法看到的环境模型吗?这项工作使这个问题可评分。一个代理…
一篇研究论文提出了‘智能体自动机学习’来评估LLM代理是否能通过交互推断隐藏的世界模型,发现性能随着任务复杂度的增加而急剧下降,并且推理模型优于非推理模型,但仍然存在困难。
LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究
本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。