标签
介绍 ReliableTableQA,一个用于训练大语言模型标注表格问答结果统计可靠性的框架,展示了小规模 SFT 数据集就足够,且 GRPO 仅在 SFT 训练不足时有帮助。
本文介绍了DataGovBench,这是一个源自政府开放数据的基准测试,旨在评估大语言模型在现实数据分析任务上的表现,包括表格问答和洞察发现。实验表明,当前的大语言模型在复杂数据分析场景中仍然表现不佳。