StocksTalk:一个支持语音的对话代理,用于网络数据的结构化查询生成
摘要
StocksTalk是一个支持语音的对话代理,将口语自然语言映射为可执行的SQL查询,用于金融数据筛选,整合检索增强生成和人在环中验证以减少错误。
arXiv:2608.18105v1 公告类型:新
摘要:StocksTalk是一个支持语音的对话系统,用于将口语金融筛选请求转化为针对真实市场数据的可执行且经过验证的结构化查询。该系统结合了流式语音识别、检索增强约束提取、基于模式的LLM SQL生成、基于规则的验证以及在交互式仪表板中的人在环中验证。与传统的模板驱动金融助手不同,StocksTalk公开了中间推理工件,包括提取的约束、规范化的金融指标、运算符接地和生成的查询,允许用户在执行前检查和完善每个阶段。为评估系统,我们策划了一个包含150个口语金融提示的基准测试,涵盖多种投资策略和输入噪声条件。实验结果表明,与基于LLM的基线方法相比,检索接地、约束查询生成和交互式验证显著提高了约束提取准确性、SQL可执行性、逻辑一致性和多轮稳定性。StocksTalk展示了透明、语音驱动的界面如何桥接自然语言交互和结构化金融分析,为对话式股票筛选和决策支持提供了有效框架。
查看缓存全文
缓存时间: 2026/08/20 10:01
# StocksTalk:基于语音交互的网络数据结构化查询生成对话代理 来源:https://arxiv.org/html/2608.18105 Vikranth Udandarao¹¹脚注标记:1 IIIT-Delhi [email protected] | Abhay Shakya¹¹脚注标记:1 IIIT-Delhi [email protected] | Tanmay Hire¹¹脚注标记:1 IIIT-Delhi [email protected] | Avinash Anand IIIT-Delhi [email protected] | Rajiv Ratn Shah IIIT-Delhi [email protected] | Daniel Wang Zhengkui 新加坡科技学院 [email protected] ###### 摘要 本文介绍了StocksTalk,这是一个交互式系统,用于从嘈杂的语音自然语言中诱导结构化的金融筛选查询。该系统解决了一个实际的结构化预测问题:将不受约束的、多属性的对话式投资意图,映射到对真实世界金融数据源可执行且经过验证的SQL查询上。 StocksTalk集成了四个组件:(1) 流式语音识别,(2) 检索增强的约束提取,(3) 基于模式定位和规则验证的、受约束的大语言模型SQL生成,以及 (4) 通过交互式仪表板实现的人在环中验证。与基于模板的金融助手不同,我们的系统展示了中间表示——提取的约束、归一化的金融指标、操作符定位和生成的SQL——允许用户在执行前确认或纠正每个阶段。 我们在一个手动策划的基准测试集上评估了该系统,该测试集包含150个语音金融提示,涵盖三种投资策略类别和两种输入噪声条件,并报告了SQL可执行性、约束提取准确性、查询编辑距离、多轮对话稳定性和延迟等指标。结果表明,与无约束生成以及不使用检索增强生成和验证的普通GPT-4o基线相比,受约束的解码和中间验证显著减少了格式错误或语义不一致的查询。该基准测试集将公开发布,以支持语音驱动文本转SQL系统的进一步研究。 *关键词* 对话式人工智能 ⋅ 金融科技 ⋅ 股票筛选 ⋅ 语音接口 ⋅ 检索增强生成 ⋅ 自然语言处理 ⋅ 投资分析 ⋅ 实时数据集成 ## 1 引言 将自然语言映射为可执行的结构化查询是机器学习和数据库研究中的一个长期挑战(Liu等人, 2026)。在金融等高风险领域,由于用户输入嘈杂、专业领域术语、时间限定词和多属性约束,这一挑战被放大了。语音交互由于转录错误和歧义性,引入了额外的不确定性。 我们将此问题定义为*不确定性下的交互式结构化预测*:给定一个描述金融筛选约束的语音语句,系统必须推断出一个与预定义金融模式对齐的、有效的、可执行的SQL查询,同时保持语义意图并确保逻辑一致性。人工智能驱动工具在各商业领域的快速采用(Bialkova, 2024)突显了对可靠、可解释接口的需求,这些接口能够调和无约束的人类意图和结构化数据系统。 现有的文本转SQL系统通常在具有干净文本输入和固定模式的基准数据集上运行(Liu等人, 2025b)。相比之下,现实世界的金融筛选引入了先前工作未解决的几个额外要求: - • 将自然语言约束定位到特定领域的金融指标, - • 归一化单位和阈值(例如,百分比与绝对值), - • 将时间限定词与可用数据字段对齐, - • 防止逻辑不一致的查询构造。 StocksTalk通过集成流式语音识别、检索增强约束提取(Gao等人, 2024)、基于模式定位提示的受约束大语言模型SQL生成(GPT-4o)以及人在环中接口中的基于规则的验证来应对这一挑战。该系统展示了中间表示——提取的约束、归一化指标和生成的SQL——允许用户在查询执行前验证正确性。 我们的主要贡献是:(1) 一个用于语音驱动金融查询诱导的模块化流水线,具有完全的中间透明性;(2) 一个包含150个在干净和噪声条件下录制的语音金融筛选提示的策划基准测试集,将公开发布;以及(3) 一个实证评估,表明受约束解码、检索增强生成定位和交互式验证各自解决了不同且非重叠的失败模式。 ## 2 定位与相关工作 #### 文本转SQL与自然语言接口数据库(NLIDBs)。 自然语言接口数据库(NLIDB)和文本转SQL生成的工作在将非结构化语言映射到可执行查询结构方面取得了显著进展(Liu等人, 2026, 2025b)。Song等人(2024)特别针对金融领域,对基于大语言模型的文本转SQL进行了基准测试,并提出了基于树的编辑距离作为可靠的评估指标。可视化查询系统如OptiqueVQS(Soylu等人, 2016)表明,具有暴露中间表示的多范式接口可以提高终端用户准确性——这是我们直接采用的原则。然而,这些系统假设输入为干净的文本,无法处理语音交互或实时网络数据源。 #### 检索增强生成。 检索增强生成流水线(Gao等人, 2024)提高了基于大语言模型系统中的事实性和领域定位性。面向知识的检索(Cheng等人, 2025)进一步整合了结构化的领域知识,幻觉缓解(Zhang和Zhang, 2025)解决了检索增强环境中的可靠性问题。代理式检索增强生成(Singh等人, 2026)将其扩展到多步骤工具使用——StocksTalk在金融筛选领域补充了这一方向。这些技术构成了我们基于检索增强生成的意图理解层的核心。 #### 对话与语音代理。 大语言模型驱动的对话代理已被部署在结构化数据收集工作流中(Liu等人, 2025a),证明了脚手架对话可以提高准确性和用户体验。代理式工作流接口(Caetano等人, 2025)扩大了人机交互的范围,但通常充当查询-响应代理,不暴露中间推理过程。商业环境中的语音驱动助手仍局限于意图分类和模板调用。StocksTalk通过将语音输入与透明、逐步的查询构建相结合,弥合了这一差距。 #### 金融大语言模型系统。 上下文工程(Mei等人, 2025)和利用大语言模型进行信息检索(Zhu等人, 2025)已被广泛综述,但在金融领域的特定部署——特别是针对实时市场数据的结构化查询诱导——仍然鲜有探索。StocksTalk直接针对这一空白。 ## 3 系统架构与工作流程 StocksTalk被实现为一个模块化的、原生的Web流水线,由四个阶段组成(图1):(1) 低延迟语音交互,(2) 检索增强的意图理解,(3) 结构化查询诱导,以及(4) 实时Web数据集成。 (图注)图1:StocksTalk架构概览。该系统将语音金融查询转化为经过验证的SQL查询,检索实时市场数据,并通过交互式仪表板支持人在环中验证。 ### 3.1 语音交互层 StocksTalk使用流式语音转文字接口(ElevenLabs STT)将不受约束的语音语句转换为结构化的文本段,同时保留检索所需的语篇线索。系统跟踪多轮对话状态并支持特定地区的对话代理,生成一个稳定的中间表示,供下游模块可靠地解读。 ### 3.2 基于检索增强生成的意图理解 转录后的语句由一个基于GPT-4o并结合模式定位提示(Gao等人, 2024)构建的检索增强生成引擎处理。一个精心策划的金融知识库——涵盖Screener.in模式的指标定义、操作符惯例和行业分类——在推理时被检索,以定位约束提取并减少幻觉(Zhang和Zhang, 2025)。检索增强生成模块执行: - • 领域感知检索,查询金融知识库获取相关的指标定义和筛选规则; - • 意图解析,提取估值阈值、行业偏好、增长过滤器和时间限定词等约束; - • 上下文保留,在多轮对话中累积和更新约束槽。 ### 3.3 结构化查询诱导 提取的约束通过一个受约束的生成模块被映射为可执行的类SQL查询,该模块基于金融文本转SQL(Song等人, 2024;Liu等人, 2025b)的进展构建。该模块执行: - • 约束验证,以确保逻辑和财务一致性; - • 操作符定位,识别关系运算符和逻辑连接符; - • 查询模式验证,防止格式错误或语义不一致的结构; - • 解释性查询合成,暴露生成的SQL以便于审计和用户控制。 ### 3.4 实时Web数据集成 经过验证的查询针对Screener.in的实时市场数据API执行。集成层提供具有弹性的API访问,在速率限制条件下采用回退策略,并为仪表板展示提供结构化格式。 ### 3.5 交互式仪表板 所有流水线阶段通过一个同步的Flask/SSE仪表板暴露,提供语音控制、带有验证状态的查询可视化、可排序的结果表以及高亮显示约束的对话历史记录。该设计优先考虑每个推理步骤的透明度,遵循对话代理设计(Liu等人, 2025a)和自然语言接口数据库界面(Soylu等人, 2016)的原则。 ## 4 评估 ### 4.1 数据集与收集 我们策划了FinScreenBench,这是一个包含150个语音金融筛选提示的基准测试集,涵盖三种投资策略类别:增长导向(50个提示)、股息导向(50个提示)和价值导向(50个提示)。每个提示包含2-5个约束,这些约束来自一个包含28个金融指标的词汇表(例如,市盈率、收入增长、股息收益率、市值、负债权益比)。提示由三位具有金融背景的标注员撰写,涵盖了多种表达风格、数值表达(基数词、序数词、近似值)和时间限定词。真实SQL查询是独立构建并交叉验证的;标注员间一致性达到了Cohen's κ=0.87。 提示由六位说话人在两种条件下录制:*干净*(安静房间,标准电容麦克风)和*嘈杂*(食堂环境噪声,55-65 dB信噪比),共产生300个音频样本。该基准测试集将在项目仓库中公开发布,以支持对语音驱动文本转SQL系统的可复现评估。 ### 4.2 基线 我们与三个基线进行比较以定位StocksTalk的性能: - • GPT-4o(普通):直接提示GPT-4o处理转录的语句和模式描述,无检索增强生成,无验证。 - • GPT-4o + RAG:检索增强生成增强的GPT-4o,不包括基于规则的验证层或受约束解码。 - • GPT-4o + RAG + 验证:完整的流水线,但不包括人在环中验证(仅自动执行)。 这些基线对应于逐步消融StocksTalk的组件,使我们能够衡量每个设计选择的边际贡献。 ### 4.3 评估指标 - • 约束提取准确性(CEA):正确识别约束的百分比,每个约束作为一个三元组(指标,操作符,阈值)进行评分;三个组成部分必须全部匹配。 - • SQL可执行性(EX):生成查询在Screener.in上无语法或模式错误即可执行的百分比。 - • 逻辑一致性率(LCR):在验证层下无矛盾或单位不匹配的查询百分比。 - • 查询编辑距离(QED):与真实查询的令牌级编辑距离(Song等人, 2024);越低越好。 - • 多轮对话稳定性(MTS):在3轮精炼对话中,约束槽被正确保留或更新的百分比。 - • 端到端延迟:从语音完成到结果可视化的挂钟时间(平均值±标准差)。 ### 4.4 主要结果 表1比较了StocksTalk与三个基线在干净输入上的表现。普通GPT-4o实现了合理的可执行性但逻辑一致性较低,因为它没有强制财务一致性的机制。添加检索增强生成显著提高了约束提取准确性。验证层在逻辑一致性方面提供了最大的单一增益(+18.3个百分点)。人在环中验证弥合了剩余的差距,尤其是在多轮对话稳定性方面。 表1:StocksTalk与基线在150个干净输入提示上的比较。CEA = 约束提取准确性;EX = SQL可执行性;LCR = 逻辑一致性率;QED = 查询编辑距离(越低越好);MTS = 多轮对话稳定性。 表2显示了StocksTalk按输入条件分解的性能。干净-嘈杂差距在约束提取准确性(-12.8个百分点)和多轮对话稳定性(-14.3个百分点)上最大,这反映了约束提取和对话跟踪对ASR在数值阈值和特定领域指标名称上的转录错误的敏感性。 表2:StocksTalk在干净和嘈杂ASR条件下对150个提示的性能。 | 指标 | 干净输入 | 嘈杂输入 | | :--- | :--- | :--- | | 约束提取准确性 (%) | 91.2 | 78.4 | | SQL可执行性 (%) | 97.5 | 89.3 | | 逻辑一致性率 (%) | 93.8 | 82.1 | | 查询编辑距离 (令牌数) | 2.1 | 5.7 | | 多轮对话稳定性 (%) | 88.6 | 74.3 | | 平均端到端延迟 (秒) | 3.1 ± 0.4 | 3.6 ± 0.7 | ### 4.5 消融研究 表3在干净输入上隔离了每个流水线组件的贡献。结果证实,没有一个单一组件能涵盖其他组件的作用:检索增强生成对约束提取至关重要,受约束解码对可执行性至关重要,验证层对逻辑一致性至关重要。移除人在环中对单轮可执行性影响不大,但对多轮对话稳定性影响更大,这与其在防止跨轮约束漂移方面的作用一致。 表3:对150个干净输入提示的消融研究。Δ表示相对于完整系统的绝对下降。 | 变体 | 约束提取准确性 (%) | SQL可执行性 (%) | 逻辑一致性率 (%) | 查询编辑距离 (令牌数) | 多轮对话稳定性 (%) | | :--- | :--- | :--- | :--- | :--- | :--- | | 完整系统 | 91.2 | 97.5 | 93.8 | 2.1 | 88.6 | | 无检索增强生成 | -14.3 | -2.1 | -4.5 | +3.2 | -5.1 | | 无验证 | -0.8 | -12.4 | -18.3 | +1.8 | -9.7 | | 无受约束解码 | -3.5 | -8.2 | -6.7 | +4.5 | -2.3 | | 无人在环中 | -0.3 | -1.2 | -0.9 | +0.1 | -7.6 | ### 4.6 交互式验证的效果
相似文章
为智能体提供可靠的“对话数据仓库”访问模式,无需原始文本到SQL
一种为AI智能体提供可靠数据仓库访问的模式,使用精心策划的语义层(Databricks Genie)而非原始文本到SQL,提高了准确性和治理能力。智能体将Genie的Conversation API作为工具调用,同时接收自然语言响应和精确SQL。
TRACE:可信检索增强对话引擎
TRACE 是一种面向公共服务聊天机器人的检索增强对话引擎,通过增强对嘈杂目录的检索质量来改进约束感知推荐,同时减少幻觉响应。
语音代理,通俗解释:STT+TTS 与 4 个可在浏览器中对话的演示代理 + 使用 RAG 和工具构建你自己的
一份使用语音转文字和文字转语音技术揭秘语音代理的指南,包含四个基于浏览器的演示代理以及使用RAG和工具的构建说明。
构建数据代理
探讨从文本转SQL到自主数据代理的演变,比较了使用LangGraph自定义构建的代理与Snowflake Cortex Analyst、Databricks Genie和PowerBI Copilot等托管平台。
在AgentSwarms沙箱中引入本地SQL与BI智能体。上传CSV并用自然语言与数据对话(Text-to-SQL + 自动图表)。
AgentSwarms推出了一个新的SQL与BI智能体工作区,允许用户上传CSV文件,用自然语言提问,自动转换为SQL查询并生成可视化图表。