标签
PRISM-VLM 是一个多维度鉴别性基准,评估紧凑型视觉语言模型在七个维度上的表现,包括任务质量和行为鲁棒性,与单维度基准相比,能提供更可靠的区分和洞察。它旨在发布一个开放流程,供社区改进AI评估方法。
PotARCin是一个多维度基准,它扩展了ARC,用于评估五个维度上的抽象推理技能,表明标准评估可能无法完全捕捉AI模型的真实能力。
论文介绍了TACT,一个用于评估全双工口语对话模型中话轮转换的基准,它使用基于意图条件的连续评分来替代二元规则,展示了与人类判断更好的一致性。
本文介绍了一项关于长上下文多项选择问答中学习上下文规划的控制研究,表明在各种实验设置下,该方法并未稳健地超越如BM25和混合检索等强检索方法。
这篇文章回顾了三年前AI模型的快速进展,比较了像Bard这样在编码测试中挣扎的早期模型与当前的Qwen 27B和Opus 5.5,并对未来的发展进行了推测。
本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。
一天内两次测试Claude Opus 5显示出显著的响应差异,这可能是由于后台设置而非模型变化所致,强调了在比较AI工具时需要记录所有设置。
OpenAI 宣布,MentalHealthBench 旨在覆盖 AI 心理健康对话的完整范围,从日常支持到急性危机场景。
DrivingBench 评估前沿AI模型(如GPT-6 Astra)能否通过控制一辆丰田卡罗拉在预定义路线上驾驶真实汽车,并追踪诸如进度、距离和token成本等指标。
本文探讨了评估生产环境中AI代理的方法,以决定是保留、改进还是关闭它们,并引用了关于成本、可靠性、人工努力和业务成果等指标的研究。
CraftBench-UE为Unreal Engine中的编码代理提供了一个确定性评估框架,通过构建、资产和运行时检查来评估游戏玩法特性,无需依赖LLM评判者。
ISA-Bench 引入了一个使用具有受限指令集的编程游戏的基准测试,以评估大型语言模型中的计算推理能力,并揭示了模型能力的洞察以及推理与执行之间的差距。
本文详述了ufakzeka-1,一个从零构建的151M参数土耳其语言模型,总成本约286美元,描述了训练流程、评估方法以及小模型训练局限性的关键发现。
本文提出ReliMap框架,用于评估基于LLM的人类行为模拟的可靠性,覆盖个体和群体层面,强调模型能力、档案完整性和覆盖范围的协同改进。
IntLawNER 是一个新的用于国际法的命名实体识别数据集和基准,涵盖了来自法律文本的金标准标注句子,并评估了模型在少样本改进方面的性能。
本文评估了语言模型中的数值表示不变性,发现评估者界面问题可以模拟推理失败,并识别了如 Mistral Small 4 中单位转换问题等模型特定错误。
本文介绍了WROP,一个用于训练世界模型中物体恒存性的数据集,并评估了14个视频模型,发布了PWM-WROP,一个160亿参数的世界模型,在续作模型中排名靠前。
SWE-Bench Pro V2是一个更新的基准测试,用于在软件工程中评估AI代理,包含来自11个代码库的642个任务,具有改进的评估协议和污染控制。