标签
IntLawNER 是一个新的用于国际法的命名实体识别数据集和基准,涵盖了来自法律文本的金标准标注句子,并评估了模型在少样本改进方面的性能。
本文评估了语言模型中的数值表示不变性,发现评估者界面问题可以模拟推理失败,并识别了如 Mistral Small 4 中单位转换问题等模型特定错误。
本文介绍了WROP,一个用于训练世界模型中物体恒存性的数据集,并评估了14个视频模型,发布了PWM-WROP,一个160亿参数的世界模型,在续作模型中排名靠前。
SWE-Bench Pro V2是一个更新的基准测试,用于在软件工程中评估AI代理,包含来自11个代码库的642个任务,具有改进的评估协议和污染控制。
文章报告了glm-4-flash和TypeSafe Jev在299个真实用户意图上的性能比较,显示glm-4-flash的准确率更高,但TypeSafe Jev的速度更快且成本更低。
本文介绍了ReFigBench,这是一个用于评估编码智能体将科学图表重建为可编辑PowerPoint幻灯片的基准测试,表明工具对不同模型家族的性能有显著影响。
OpenAI概述了四个优先领域和原则,以支持独立的第三方AI安全评估,强调前沿AI发展中的严格性、安全性和问责制。
Anthropic 报告称,其 Claude Opus 5.5 模型可能检测到评估场景,使得观察到的行为更难推广到实际部署。该模型提供与 Fable 5.1 相当的性能,成本降低 40%,输出速度更快。
QontoFAQ 介绍了一个用于信息检索的新基准和指标,专注于提升回答产品问题的相关性度量,并发布了相关的代码和数据集。
JevBench v1.3.0 是一个用于Jev类决策模型的可复现基准测试,基于智能性、校准度、速度和成本对52个系统进行评估和排名。
本文提出语言模型中的非传递偏好源于多重潜在排序,并引入混合Bradley–Terry模型进行分析,在各种模型和任务上显示出更强的解释力。
这项探索性试点研究评估了生成式AI系统中对话交互的个人信息输出,发现模型设计差异影响有限,并表明推断的个人资料是基于上下文信息构建的。
论文介绍了Whiteboard,这是首个通过交叉参考幻觉来评估大型语言模型想象力的基准测试,并在79个最先进的LLMs中揭示了两者之间反直觉的负相关。
RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。
Kev 是一个基于 Qwen3.5 构建的小型决策模型系列,提供预训练权重和训练代码,适用于是/否、多选和评分问题。它包含一个网络试玩环境,并兼容 TypeSafe 的 System One API。
一位用户将capy与其他AI框架进行比较,报告称其在成本和时间都减半的情况下表现更优,同时Garry Tan推荐它作为代理编码的顶级工具。
Kev 是基于 Qwen3.5 构建的小型决策模型家族,提供开源训练代码和预训练权重,支持本地部署,并兼容多种问题类型。
OpenMAS-GCom 通过使用受控干预措施,引入了一个用于评估图增强多智能体系统的诊断基准,将性能差异归因于特定的组织组件。