ground-truth

标签

Cards List
#ground-truth

Era by Eon 基准测试:用于评估LLM代理的生成型企业环境,具有精确的基准真相

arXiv cs.AI · 2026-09-11 缓存

Era by Eon 基准测试生成一个完整的虚构企业,包含模拟器和数据库,用于评估LLM代理在企业工具上的表现,提供精确的基准真相以实现准确评分。

0 人收藏 0 人点赞
#ground-truth

在发布前制造一个黄金标准评估数据集

Reddit r/AI_Agents · 2026-07-23

一位开发者分享了为没有用户的AI产品创建黄金标准评估数据集的挑战,考虑了合成数据生成和对抗性测试,以避免发布后的重构。

0 人收藏 0 人点赞
#ground-truth

立场:每一个真实标准都是人为构建的,而非客观真理

arXiv cs.LG · 2026-07-14 缓存

本立场论文认为,机器学习中的真实标准数据集并非客观真理,而是由选择塑造的人为构建,并主张阐明这些选择以提高可靠性、透明度和问责性。

0 人收藏 0 人点赞
#ground-truth

使用LLM驱动行为与运动约束的移动性异常生成

arXiv cs.AI · 2026-06-10 缓存

介绍一种生成框架,利用LLM代理将行为异常注入模拟轨迹中,并应用运动约束和地图约束,生成带有真实标签的逼真异常移动数据。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈