Polaris: 从检索反馈中学习生成表格描述

arXiv cs.CL 论文

摘要

Polaris 使用 DPO 训练 LLM 直接从检索反馈中生成表格描述,在表格检索任务中显著超越了 AutoDDG 等先前方法。

arXiv:2608.17171v1 公告类型:新 摘要:许多以表格为中心的NLP任务,如NL2SQL,首先使用关键词搜索从大型集合中检索相关表格。最近的研究使用LLMs生成自然语言表格描述以改善检索,但这些描述通常针对流畅性而非检索效果进行优化。我们提出Polaris,这是一个训练LLM直接从检索反馈中生成表格描述的系统。我们的关键见解是,现有的表格检索基准已经包含了此任务所需的监督:给定查询-表格相关性判断,我们为每个表格生成多个候选描述,根据其BM25检索效果进行排序,并使用生成的偏好对通过直接偏好优化(DPO)对LLM进行微调。Polaris进一步在生成前扩展缩写的表格和列名,以减少词汇不匹配。大量实验表明,Polaris超越了最先进的AutoDDG解决方案,通常优势显著。更广泛地说,我们的结果表明,检索基准可以重新用作训练LLM生成检索导向元数据的监督。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:51

# Polaris:从检索反馈中学习生成表格描述  
来源:https://arxiv.org/html/2608.17171  
作者:Tuan Minh Phan, AnHai Doan  
所属机构:威斯康星大学麦迪逊分校  
联系方式:\{tingcai, minhrua, anhai\}@cs.wisc.edu  

###### 摘要  
许多以表格为中心的自然语言处理任务(如NL2SQL)首先通过关键词搜索从大型集合中检索相关表格。近期研究使用大语言模型生成自然语言表格描述以改进检索,但这些描述通常为流畅性而非检索效果优化。我们提出Polaris系统,通过检索反馈直接训练大语言模型生成表格描述。关键洞察在于:现有表格检索基准已包含该任务所需监督信息——给定查询-表格相关性判断,我们为每个表格生成多个候选描述,按其BM25检索效果排序,并利用生成的偏好对通过直接偏好优化微调大语言模型。Polaris在生成前还会扩展缩写的表格和列名,以减少词汇不匹配问题。大量实验表明,Polaris显著优于当前最先进的AutoDDG方案。更广泛而言,我们的研究证明检索基准可重新用作训练大语言模型生成检索导向元数据的监督信号。  

## 1 引言  
表格数据在企业、科研、政府机构等领域广泛存在。过去十年间,针对表格数据的自然语言处理任务研究显著增长,例如NL2SQL、表格问答、基于模式的关联检测等。这些任务大多依赖基础操作:对表格进行关键词搜索。这是因为实际场景中待处理的表格集往往极为庞大。因此,我们需要根据用户意图(通常以自然语言或关键词表达)先对表格执行关键词搜索,筛选出少量相关表格,再执行特定任务推理。以NL2SQL为例:给定自然语言查询“显示2025年季度销售额”,许多NL2SQL方案会先通过关键词搜索检索相关表格,再针对这些表格生成SQL查询。  

```sql
ACTEMPS(EID, FN, LN, SAL)
此表格存储当前在职员工记录,每行包含员工名、姓氏和薪资。支持人力资源与薪酬分析,如员工补偿、工资分布和人员统计报告。
```  
**图1:表格描述示例**  

尽管关键,表格的关键词搜索极具挑战性,因为表格和列名通常晦涩简短(如“DTPh”、“ActEmployees”),导致难以检索。为此,近期许多研究提出利用大语言模型生成自然语言表格描述,再对这些描述进行关键词搜索以查找相关表格(见图1)。据我们所知,该领域最先进成果是AutoDDG,实验证明其性能优于六种其他方案。尽管前景广阔,AutoDDG仍存在以下主要局限:  

本文介绍Polaris系统,旨在解决这些局限并显著推进技术前沿:  
1. **简化生成流程**:AutoDDG采用复杂多步骤流程(需多次大语言模型调用)分析表格元数据与元组后生成描述。我们证明更简单的流程(仅需单次大语言模型调用)可达到相当甚至更优性能,并解释其原理。  
2. **名称扩展优化**:AutoDDG直接使用原始表格/列名。实际中这些名称常为缩写(如“DTPh”表示“daytime phone”),导致大语言模型生成泛化描述而遗漏关键术语。我们证明通过Columbo方案将名称扩展为完整英文短语,可为大语言模型提供更丰富输入,显著提升生成质量。  
3. **检索导向微调**:AutoDDG直接使用原始大语言模型,未进行微调。我们借鉴人类反馈强化学习思路,利用标注数据集(包含表格-查询-相关性评分三元组)评估描述质量,并通过直接偏好优化技术微调大语言模型,使其生成更利于关键词搜索的描述。  
4. **多模态检索融合**:AutoDDG仅依赖生成的表格描述进行检索。我们证明结合描述与其他表格元数据(如名称扩展、上下文信息)可显著提升搜索准确率。  
5. **构建大规模基准**:AutoDDG仅使用两个标注数据集评估。我们清理了三个已有基准并创建三个新数据集,构建包含六数据集的检索评估基准(最大规模表格关键词搜索评测集)。  

**核心贡献**:  
- 开发Polaris系统,采用更简流程、名称扩展技术、检索导向微调策略及多模态检索方法  
- 构建六数据集评测基准,为当前最大规模表格关键词搜索评测集  
- 实验证明Polaris在基准测试中显著优于AutoDDG(如NDCG@100最高提升44.6%),且生成描述长度减少47-59%。研究表明检索基准可复用为训练大语言模型的监督信号  

代码开源地址:github.com/anhaidgroup/polaris  
数据集发布地址:hf.co/collections/anhaidgroup/polaris-v1  

## 2 预备知识  
本节先介绍AutoDDG,再引出Polaris的问题定义。  

### AutoDDG:  
该方案采用复杂多步骤流程生成表格描述。对于特定表格T,流程输入包括表格名、列名、附加元数据(若有)、示例元组值(若可用)。首先生成表格统计信息、主题和列摘要,最终生成面向关键词搜索的描述d(T)。该流程至少需四次大语言模型调用。给定关键词查询Q,AutoDDG返回按描述d(T)与查询Q相似度(BM25 TF/IDF分数)排序的表格列表。研究证明AutoDDG优于六种方案,包括两种预训练数据到文本模型及采用大语言模型摘要模式的Pneuma方案。  

**图2:Polaris整体架构**  

### Polaris表格描述生成:  
与AutoDDG类似,我们使用表格元数据(表格名、列名、附加上下文如表格标题)生成描述,但**不使用元组数据**(因隐私/法律限制)。实验表明即使不使用元组,Polaris仍优于AutoDDG。核心创新在于:利用标注数据集通过微调优化生成质量。  

### Polaris关键词搜索:  
沿用AutoDDG的检索设置:基于描述d(T)与查询Q的BM25分数排序表格。未来将探索嵌入向量等其他相似度计算方式。由于生成的描述存在局限,我们进一步提出结合描述与其他元数据的混合检索方案,显著提升准确率。  

## 3 Polaris解决方案  
Polaris分两阶段生成描述:微调大语言模型与生成描述。  

### 阶段1(图2上部):  
1. 对训练表格集进行名称扩展(如“eSal”→“employee salary”)  
2. 未微调的大语言模型基于扩展名称和上下文为每个表格生成多个候选描述  
3. 利用标注数据集对描述排序  
4. 通过直接偏好优化微调大语言模型  

### 阶段2(图2下部):  
1. 对目标表格集N进行名称扩展  
2. 微调后的大语言模型为每个表格生成描述  

### 3.1 表格/列名扩展  
假设Polaris可访问标注数据集集合D={D₁,...,Dₙ},每个数据集包含(表格,查询,相关性评分)三元组。为提升生成质量,我们使用Columbo方案将表格/列名扩展为完整英文短语(如“DTPh”→“daytime phone”),解决原始名称晦涩简短导致大语言模型生成泛化描述的问题。  

### 3.2 初始描述生成  
为标注数据集中的每个表格T构造提示词,输入未微调的大语言模型M。提示词包含名称扩展结果、上下文信息及改编自AutoDDG的示例。要求大语言模型生成包含六个字段的JSON描述:数据集概述、核心主题、应用场景、概念/同义词、关键词/主题、附加上下文。  

对于相关性评分>0的“黄金表格”,使用非零温度和top-p采样生成k≥2个候选描述;其余表格仅生成单个描述。  

### 3.3 描述排序  
利用标注数据集自动评估描述质量。以图3为例:  
- 构建两个语料库C₁和C₂,除表格T₁使用不同描述(d₁₁/d₁₂)外完全相同  
- 执行查询Q₁后,若C₁中T₁排名高于C₂,则判定d₁₁优于d₁₂  

**图3:利用标注数据集生成排序**  

(后续章节继续阐述实验设置与分析)

相似文章

DiPO:基于解耦困惑度的策略优化,实现细粒度探索-利用权衡

Hugging Face Daily Papers

# 论文页面 - DiPO:基于解耦困惑度的策略优化,实现细粒度探索-利用权衡 来源:[https://huggingface.co/papers/2604.13902](https://huggingface.co/papers/2604.13902) 作者:,,,,,,,,,, ## 摘要 一种面向大语言模型的新型强化学习方法,通过基于困惑度的样本划分与双向奖励分配机制,解决探索-利用权衡问题。[强化学习](https:

Disco-RAG: 话语感知检索增强生成

arXiv cs.CL

Disco-RAG 提出了一个话语感知的检索增强生成框架,通过块内话语树和块间修辞图整合话语信号,以改进大语言模型的知识综合能力。该方法在问答和摘要生成基准测试中达到最先进的效果,无需微调。

Polar Probe线性解码LLM中的语义结构

arXiv cs.CL

本文提出了一种Polar Probe,通过在学习的子空间中用距离和方向表示实体关系,从LLM激活中线性恢复语义结构。在算术、视觉场景、家谱、地铁地图和社交互动等多个领域的测试表明,该编码出现在中间层,能泛化到新实体,并对模型预测产生因果影响。