scalable-evaluation

标签

Cards List
#scalable-evaluation

LivingArena:LLM是否知道其他LLM不知道的?同伴探查作为可扩展评估

arXiv cs.AI · 2026-07-29 缓存

本文介绍LivingArena,这是一个自动化的评估框架,其中LLM通过生成问题来探查彼此弱点,实现抗污染和可扩展的评估,并能随模型改进而适应。

0 人收藏 0 人点赞
#scalable-evaluation

法官代码化:通过程序蒸馏实现可扩展评估

arXiv cs.AI · 2026-07-28 缓存

本文介绍了PAJAMA,这是一个将大语言模型作为评判者的决策逻辑蒸馏到程序化评判者中的系统,消除了每次样本的API成本,同时匹配了13B大语言模型评判者的性能,并为可扩展评估提供了透明度和效率改进。

0 人收藏 0 人点赞
#scalable-evaluation

超越人类尺度的智能测量

arXiv cs.AI · 2026-07-09 缓存

本文提出了一种新的范式,用于测量超越人类能力的智能,采用对抗性心理测量评分系统,其中模型生成挑战以区分其他系统,从而实现与AI能力同步扩展的评估。

0 人收藏 0 人点赞
#scalable-evaluation

通过Fisher信息度量模型鲁棒性:谱边界、理论保证与实用算法

Hugging Face Daily Papers · 2026-06-03 缓存

本文提出了一种基于Fisher信息矩阵谱范数的攻击无关鲁棒性度量,为深度神经网络提供了理论边界和可扩展的评估方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈