evaluation

标签

Cards List
#evaluation

PRISM-VLM:一个面向紧凑型视觉语言模型的多维度鉴别性基准

arXiv cs.CL ↗ · 昨天 缓存

PRISM-VLM 是一个多维度鉴别性基准,评估紧凑型视觉语言模型在七个维度上的表现,包括任务质量和行为鲁棒性,与单维度基准相比,能提供更可靠的区分和洞察。它旨在发布一个开放流程,供社区改进AI评估方法。

0 人收藏 0 人点赞
#evaluation

PotARCin:抽象推理任务技能获取的多维度评估

arXiv cs.AI ↗ · 昨天 缓存

PotARCin是一个多维度基准,它扩展了ARC,用于评估五个维度上的抽象推理技能,表明标准评估可能无法完全捕捉AI模型的真实能力。

0 人收藏 0 人点赞
#evaluation

沉默或重叠并非失败:全双工口语对话模型基于意图条件的话轮转换评估

arXiv cs.CL ↗ · 昨天 缓存

论文介绍了TACT,一个用于评估全双工口语对话模型中话轮转换的基准,它使用基于意图条件的连续评分来替代二元规则,展示了与人类判断更好的一致性。

0 人收藏 0 人点赞
#evaluation

超越重叠:估算基准暴露的因果效应

arXiv cs.CL ↗ · 昨天 缓存

本文提出了一种方法来估计基准暴露对AI模型性能的因果效应,超越传统的重叠技术以实现更稳健的评估。

0 人收藏 0 人点赞
#evaluation

当学习的上下文规划未能超越强检索:一项针对规划、路由和重排序在长上下文问答中的控制研究

arXiv cs.CL ↗ · 昨天 缓存

本文介绍了一项关于长上下文多项选择问答中学习上下文规划的控制研究,表明在各种实验设置下,该方法并未稳健地超越如BM25和混合检索等强检索方法。

0 人收藏 0 人点赞
#evaluation

你们还记得蛇模型测试吗?

Reddit r/LocalLLaMA ↗ · 昨天

这篇文章回顾了三年前AI模型的快速进展,比较了像Bard这样在编码测试中挣扎的早期模型与当前的Qwen 27B和Opus 5.5,并对未来的发展进行了推测。

0 人收藏 0 人点赞
#evaluation

ExplorationBench:衡量AI系统在可验证外星世界中的探索能力

Hugging Face Daily Papers ↗ · 昨天 缓存

本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。

0 人收藏 0 人点赞
#evaluation

下午测试的AI与晚上测试的AI可能不同,即使名称相同

Reddit r/artificial ↗ · 2天前

一天内两次测试Claude Opus 5显示出显著的响应差异,这可能是由于后台设置而非模型变化所致,强调了在比较AI工具时需要记录所有设置。

0 人收藏 0 人点赞
#evaluation

大多数心理健康基准测试专注于紧急情况。MentalHealthBench 旨在覆盖全面范围…

X AI KOLs ↗ · 2天前 缓存

OpenAI 宣布,MentalHealthBench 旨在覆盖 AI 心理健康对话的完整范围,从日常支持到急性危机场景。

0 人收藏 0 人点赞
#evaluation

GPT-6 Astra 获得了驾驶汽车的能力

Hacker News Top ↗ · 2天前 缓存

DrivingBench 评估前沿AI模型(如GPT-6 Astra)能否通过控制一辆丰田卡罗拉在预定义路线上驾驶真实汽车,并追踪诸如进度、距离和token成本等指标。

0 人收藏 0 人点赞
#evaluation

如何决定哪些AI代理值得在生产环境中保留?

Reddit r/AI_Agents ↗ · 2天前

本文探讨了评估生产环境中AI代理的方法,以决定是保留、改进还是关闭它们,并引用了关于成本、可靠性、人工努力和业务成果等指标的研究。

0 人收藏 0 人点赞
#evaluation

勿信基准测试:通用LLM排名的局限与任务特定评估的倡导

arXiv cs.AI ↗ · 2天前 缓存

本文探讨了通用LLM排名的局限性,包括基准饱和与商业激励,并倡导任务特定评估方法以提高可靠性。

0 人收藏 0 人点赞
#evaluation

CraftBench-UE:Unreal Engine编码代理的确定性评估

arXiv cs.AI ↗ · 2天前 缓存

CraftBench-UE为Unreal Engine中的编码代理提供了一个确定性评估框架,通过构建、资产和运行时检查来评估游戏玩法特性,无需依赖LLM评判者。

0 人收藏 0 人点赞
#evaluation

ISA-Bench:面向跨指令集架构计算推理的基准测试

arXiv cs.AI ↗ · 2天前 缓存

ISA-Bench 引入了一个使用具有受限指令集的编程游戏的基准测试,以评估大型语言模型中的计算推理能力,并揭示了模型能力的洞察以及推理与执行之间的差距。

0 人收藏 0 人点赞
#evaluation

ufakzeka-1: 从零开始构建与评估一个151M参数的土耳其语言模型

arXiv cs.CL ↗ · 2天前 缓存

本文详述了ufakzeka-1,一个从零构建的151M参数土耳其语言模型,总成本约286美元,描述了训练流程、评估方法以及小模型训练局限性的关键发现。

0 人收藏 0 人点赞
#evaluation

基于LLM的人类行为模拟可靠性解析

arXiv cs.CL ↗ · 2天前 缓存

本文提出ReliMap框架,用于评估基于LLM的人类行为模拟的可靠性,覆盖个体和群体层面,强调模型能力、档案完整性和覆盖范围的协同改进。

0 人收藏 0 人点赞
#evaluation

IntLawNER: 国际法中的命名实体识别数据集与基准

arXiv cs.AI ↗ · 2天前 缓存

IntLawNER 是一个新的用于国际法的命名实体识别数据集和基准,涵盖了来自法律文本的金标准标注句子,并评估了模型在少样本改进方面的性能。

0 人收藏 0 人点赞
#evaluation

相同数量,不同答案:语言模型中的数值表示不变性

arXiv cs.CL ↗ · 2天前 缓存

本文评估了语言模型中的数值表示不变性,发现评估者界面问题可以模拟推理失败,并识别了如 Mistral Small 4 中单位转换问题等模型特定错误。

0 人收藏 0 人点赞
#evaluation

训练世界模型中的物体恒存性

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了WROP,一个用于训练世界模型中物体恒存性的数据集,并评估了14个视频模型,发布了PWM-WROP,一个160亿参数的世界模型,在续作模型中排名靠前。

0 人收藏 0 人点赞
#evaluation

SWE-Bench Pro V2(阅读时间9分钟)

TLDR AI ↗ · 2天前 缓存

SWE-Bench Pro V2是一个更新的基准测试,用于在软件工程中评估AI代理,包含来自11个代码库的642个任务,具有改进的评估协议和污染控制。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈