reliable-evaluation

标签

Cards List
#reliable-evaluation

DAREBench: 部署感知与可靠评估模型作为代理

arXiv cs.AI · 2026-09-10 缓存

DAREBench 是一个专为部署感知和可靠评估 AI 模型作为代理而设计的基准测试,评估多模态任务和执行形式,结果显示在商业模型和开源权重模型之间存在准确性和成本的权衡。

0 人收藏 0 人点赞
#reliable-evaluation

工业化预测驱动推断:用于可靠GenAI与智能体系统评估的GLIDE库

arXiv cs.AI · 2026-06-01 缓存

GLIDE是一个开源Python库,统一了最先进的预测驱动推断方法,用于生成式AI和智能体系统的无偏评估,能够在保证有效不确定性估计的同时节省标注成本。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈