automatic-evaluation

标签

Cards List
#automatic-evaluation

生成减少智能体评估中过度信任的无奖励评判标准

arXiv cs.AI · 2026-08-17 缓存

RubricForge从带标签的轨迹中诱导评估标准,以减少语言模型智能体评估中的过度信任,增强保真度,而无需环境访问。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈