eval-set

标签

Cards List
#eval-set

你的评估集一旦被代理优化,就不再是评估集了

Reddit r/AI_Agents · 2026-07-29

详细讨论评估集在代理循环中用于选择时如何退化,以及三种防御措施:通过压缩评分统计试验次数、逐步揭示评估数据、将评分器置于无法调用的工具边界之后。

0 人收藏 0 人点赞
#eval-set

我不再相信模型基准测试,开始运行自己的评估集,这是变化所在[D]

Reddit r/MachineLearning · 2026-06-25

作者描述了由于供应商创建的指标、自报参数和缺乏独立验证而对公开AI模型基准测试失去信心,并主张从真实生产流量中构建自定义评估集以进行更相关的模型比较。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈