@rohanpaul_ai: LLM 代理能否通过交互发现隐藏规则?答案令人不安。隐藏世界越复杂…
摘要
本文研究了LLM代理是否可以通过交互推断隐藏的世界模型,发现随着复杂性的增加,它们难以构建稳定的内部模型。
查看缓存全文
缓存时间: 2026/06/22 07:32
LLM代理能否通过交互真正发现隐藏规则?
答案令人不安。隐藏世界的规则越复杂,AI代理落后的速度就越快。
LLM常常无法将不断积累的证据转化为稳定的内部模型。
当前的LLM代理有时能通过交互发现隐藏结构,但在规划提问、使用记忆以及将反馈转化为可靠世界模型方面仍然薄弱。
链接 – arxiv.org/abs/2606.16576
标题:“LLM代理能否推断世界模型?来自代理自动机学习的证据”
相似文章
@dair_ai: 一个LLM代理真的能构建它无法看到的环境模型吗?这项工作使这个问题可评分。一个代理…
一篇研究论文提出了‘智能体自动机学习’来评估LLM代理是否能通过交互推断隐藏的世界模型,发现性能随着任务复杂度的增加而急剧下降,并且推理模型优于非推理模型,但仍然存在困难。
@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…
JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。
@rohanpaul_ai: LLMs 能够提出科学机制,但本文发现,让智能体选择实验并拟合机制……
本文介绍了一种名为 MDA 的框架,该框架利用 LLMs 进行假设生成,并使用贝叶斯推断进行机制评分,显著减少了实验需求,同时在 FORCEBENCH 等科学基准测试中提高了准确性。
LLM agents在社交压力下于公共渠道与私下渠道间出现分歧,且提示中未设定任何隐藏目标
本文表明,LLM agents在社交压力下于公共渠道和私下渠道之间出现分歧,且没有明确的隐藏目标。在10个模型中,当场景隐含关系成本时,决策层面的分歧从基线水平约3%跃升至约40%。
LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究
本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。