通过文本-表格建模从有限交互中预测AI代理的决策

Hugging Face Daily Papers 论文

摘要

本文提出了一种方法,通过将表格特征与基于LLM的文本表示以及来自冻结观察者模型的隐藏状态相结合,在谈判游戏中预测不熟悉AI代理的决策,优于直接提示方法。

AI代理以自然语言与不熟悉的对手进行谈判和交易:面对未知卖家的买家机器人,或与供应商谈判的采购助手。在此类交互中,对手的LLM、提示词、控制逻辑和基于规则的备选方案是隐藏的,而每个决策都可能带来金钱后果。我们提出一个问题:代理能否在少量交互后预测不熟悉对手的下一个决策?为了避免真实世界中的记录混淆,我们在受控的讨价还价和谈判游戏中研究该问题,并将其形式化为目标自适应的文本-表格预测:每个决策点是一个表格行,结合了结构化游戏状态、报价历史和对话,同时将同一目标代理(即被建模的对手)之前的K个游戏作为标注的适应示例提供给提示词。我们的模型构建于一个表格基础模型之上,该模型使用游戏状态特征和基于LLM的文本表示来表示行,并添加了LLM-as-Observer作为额外表示:一个小的冻结LLM读取决策时的状态和对话;其答案被丢弃,其隐藏状态成为面向决策的特征,使LLM成为编码器而非直接的小样本预测器。在13个前沿LLM代理上进行训练,并在91个保留的脚手架代理上进行测试,完整模型优于直接LLM-as-Predictor提示方法以及游戏+文本特征基线。在此表格模型中,观察者特征的贡献超越了其他特征方案:在K=16时,它们将两个任务中的响应预测AUC提高了约4个点,并将讨价还价报价预测误差降低了14%。这些结果表明,将对手预测形式化为目标自适应的文本-表格任务可以实现有效的适应,并且隐藏的LLM表示暴露了直接提示无法发现的决策相关信号。
查看原文
查看缓存全文

缓存时间: 2026/05/14 08:17

论文页面 - 通过文本表格建模从有限交互中预测AI智能体的决策

来源:https://huggingface.co/papers/2605.12411

摘要

AI智能体通过将表格特征与基于LLM的文本表示以及冻结观察者模型的隐藏状态相结合,可以在谈判博弈中预测对手的决策,其性能优于直接提示方法。

AI智能体使用自然语言与陌生的对手进行谈判和交易:一个买家机器人面对未知的卖家,或一个采购助理与供应商谈判。在此类交互中,对手的LLM、提示词、控制逻辑和基于规则的备选方案都是隐藏的,而每个决策都可能产生金钱后果。我们提出问题:一个智能体能否从少量交互中预测陌生对手的下一个决策?为了避免真实世界中的日志混杂因素,我们在受控的讨价还价和谈判博弈中研究该问题,并将其形式化为目标自适应文本表格预测:每个决策点都是一个表格行,包含结构化博弈状态、出价历史和对话,同时将同一目标智能体(即被建模的对手)的K个先前博弈作为带标签的适应示例放入提示中。我们的模型构建于表格基础模型之上,该模型使用博弈状态特征和基于LLM的文本表示来表示行,并添加LLM作为观察者作为额外的表示:一个冻结的小型LLM读取决策时刻的状态和对话;其答案被丢弃,而隐藏状态成为面向决策的特征,使LLM成为一个编码器而非直接的少样本预测器。在13个前沿LLM智能体上进行训练,并在91个保留的脚手架智能体上进行测试,完整的模型优于直接的LLM作为预测器提示以及博弈+文本特征的基线。在此表格模型中,观察者特征的贡献超过了其他特征方案:在K=16时,它们将两个任务的响应预测AUC提升了约4个点,并将讨价还价的出价预测误差降低了14%。这些结果表明,将对手预测公式化为目标自适应文本表格任务能够实现有效的适应,并且LLM的隐藏表示暴露了直接提示无法呈现的与决策相关的信号。

查看arXiv页面 (https://arxiv.org/abs/2605.12411)查看PDF (https://arxiv.org/pdf/2605.12411)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12411)

在你的智能体中获取这篇论文:

hf papers read 2605\.12411

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

请在模型README.md中引用arxiv.org/abs/2605.12411以将其链接到此页面。

引用此论文的数据集0

没有数据集链接到此论文

请在数据集README.md中引用arxiv.org/abs/2605.12411以将其链接到此页面。

引用此论文的Spaces0

没有Space链接到此论文

请在Space README.md中引用arxiv.org/abs/2605.12411以将其链接到此页面。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)以将其链接到此页面。

相似文章

探索语言与非语言代理之间的协作

Hugging Face Daily Papers

本文介绍了LLAMIA-Bench,一个用于语言模型和非语言代理之间协作棋类任务的基准,并提出了潜在状态内化方法以超越基于文本的表述,其中14B模型匹配或超越了如GPT-5.1等前沿模型。

多智能体协商中基于对手建模的偏好估计

arXiv cs.CL

本文提出了一种新颖的偏好估计方法,将大型语言模型(LLM)的自然语言信息集成到结构化贝叶斯对手建模框架中,用于多智能体协商。该方法利用LLM从话语中提取定性线索,并将其转换为概率格式,在多方协商基准上展示了改进的协议达成率和偏好估计准确性。