criterion-revision

标签

Cards List
#criterion-revision

大语言模型智能体中标准校准修订:失效模式与一种基于追踪锚定的协议

arXiv cs.AI · 2026-08-24 缓存

本文研究了语言模型智能体中的标准校准修订问题,识别了当前实现(如CMB-0.1)中的失效模式,并提出了一种新的基于追踪锚定的协议(CMB-0.4),以实现未来更精确的评估。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈