标签
Argo-Bench 提出了一个包含 210 项企业级数据科学任务的评测框架,构建于一个模拟外卖平台之上,该平台拥有一个包含 235 张表、75 亿行数据的 ERP 数据仓库。该框架测试的智能体需要在数据中进行导航并采取行动,而非仅仅生成 SQL。在 14 个前沿模型和开源权重模型中,表现最强的模型平均得分也仅为 59.5 分,凸显了数据智能体在真实场景下能力上的显著差距。
本文提出了一种平衡监督微调和强化学习的方法,用于训练长期广告代理,表明定向RL可以减少数据泄露,并提升企业分析任务的性能。
本文提出了一种用于受控数据分析的小型分析代数,证明了确定性策略执行方法在跨实验中保留分析意义和证据方面优于运行时规划。
本文介绍了一种受控分析框架,该框架将语言模型用于意图解释与确定性策略执行相结合,执行预批准的程序,在运行时规划代理失败的情况下实现了完全可靠性。
本文介绍了一种生产级企业分析系统,该系统通过领域专家技能和知识编译,将交互模式从问题优先反转为分析师优先,从而实现带有验证指标和建议问题的主动分析。
本文提出了一种基于CrewAI构建的多代理框架,用于自动化对话式商业智能。该框架使用五个专门的AI代理来处理查询、检索数据并生成洞察。评估显示,在准确性和质量上较基线有显著提升。
本论文提出了SSAS(语法与语义上下文评估汇总)框架,旨在通过分层分类和迭代汇总来减少噪声和方差,提高基于大语言模型的情感预测的一致性。在三个行业标准数据集上的实证评估显示,数据质量和企业决策可靠性可提升30%。