标签
介绍Spider 2.0-AIFunc,这是一个包含125个真实世界数据库、465个实例的基准测试,用于评估使用云平台AI函数的AI原生SQL查询。评估了十种最先进的模型,发现专有模型达到67-70%的准确率,而开源模型则落后。
本文提出了一种基于语义层的NL2SQL智能体,通过推理精心设计的语义模型将意图与物理执行解耦,在Spider2-snow基准上实现了94.15%的执行准确率。