通过文本-表格建模从有限交互中预测AI代理的决策
摘要
本文提出了一种方法,通过将表格特征与基于LLM的文本表示以及来自冻结观察者模型的隐藏状态相结合,在谈判游戏中预测不熟悉AI代理的决策,优于直接提示方法。
查看缓存全文
缓存时间: 2026/05/14 08:17
论文页面 - 通过文本表格建模从有限交互中预测AI智能体的决策
来源:https://huggingface.co/papers/2605.12411
摘要
AI智能体通过将表格特征与基于LLM的文本表示以及冻结观察者模型的隐藏状态相结合,可以在谈判博弈中预测对手的决策,其性能优于直接提示方法。
AI智能体使用自然语言与陌生的对手进行谈判和交易:一个买家机器人面对未知的卖家,或一个采购助理与供应商谈判。在此类交互中,对手的LLM、提示词、控制逻辑和基于规则的备选方案都是隐藏的,而每个决策都可能产生金钱后果。我们提出问题:一个智能体能否从少量交互中预测陌生对手的下一个决策?为了避免真实世界中的日志混杂因素,我们在受控的讨价还价和谈判博弈中研究该问题,并将其形式化为目标自适应文本表格预测:每个决策点都是一个表格行,包含结构化博弈状态、出价历史和对话,同时将同一目标智能体(即被建模的对手)的K个先前博弈作为带标签的适应示例放入提示中。我们的模型构建于表格基础模型之上,该模型使用博弈状态特征和基于LLM的文本表示来表示行,并添加LLM作为观察者作为额外的表示:一个冻结的小型LLM读取决策时刻的状态和对话;其答案被丢弃,而隐藏状态成为面向决策的特征,使LLM成为一个编码器而非直接的少样本预测器。在13个前沿LLM智能体上进行训练,并在91个保留的脚手架智能体上进行测试,完整的模型优于直接的LLM作为预测器提示以及博弈+文本特征的基线。在此表格模型中,观察者特征的贡献超过了其他特征方案:在K=16时,它们将两个任务的响应预测AUC提升了约4个点,并将讨价还价的出价预测误差降低了14%。这些结果表明,将对手预测公式化为目标自适应文本表格任务能够实现有效的适应,并且LLM的隐藏表示暴露了直接提示无法呈现的与决策相关的信号。
查看arXiv页面 (https://arxiv.org/abs/2605.12411)查看PDF (https://arxiv.org/pdf/2605.12411)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12411)
在你的智能体中获取这篇论文:
hf papers read 2605\.12411
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
请在模型README.md中引用arxiv.org/abs/2605.12411以将其链接到此页面。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集README.md中引用arxiv.org/abs/2605.12411以将其链接到此页面。
引用此论文的Spaces0
没有Space链接到此论文
请在Space README.md中引用arxiv.org/abs/2605.12411以将其链接到此页面。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)以将其链接到此页面。
相似文章
探索语言与非语言代理之间的协作
本文介绍了LLAMIA-Bench,一个用于语言模型和非语言代理之间协作棋类任务的基准,并提出了潜在状态内化方法以超越基于文本的表述,其中14B模型匹配或超越了如GPT-5.1等前沿模型。
多智能体协商中基于对手建模的偏好估计
本文提出了一种新颖的偏好估计方法,将大型语言模型(LLM)的自然语言信息集成到结构化贝叶斯对手建模框架中,用于多智能体协商。该方法利用LLM从话语中提取定性线索,并将其转换为概率格式,在多方协商基准上展示了改进的协议达成率和偏好估计准确性。
多行动,少决策:技能引导的自适应动作分块用于长期任务LLM代理
本文提出'Space',一种技能引导的自适应动作分块方法,用于长期任务LLM代理,将成功率提高7.0%–31.3%,并将LLM决策轮次减少高达78.9%。
弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型
本文系统综述了面向基于LLM的智能体的文本世界模型,涵盖基础、构建范式、在规划与训练中的应用以及评估方法。
TabClaw:用于电子表格操作和表格推理的交互式自进化智能体
TabClaw 是一个开源的交互式 AI 智能体,用于电子表格操作和表格推理,利用 LLM 自动化数据分析,支持多表格推理,并通过记忆和技能提取适应个人偏好。