标签
本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。
论文介绍了Whiteboard,这是首个通过交叉参考幻觉来评估大型语言模型想象力的基准测试,并在79个最先进的LLMs中揭示了两者之间反直觉的负相关。
HARMONY是一个开源框架,利用分层代理推理和VLMs从单张室内图像重建组合式3D场景,在视觉质量上与GPT-6 Astra竞争,并在几何对齐上表现更优。
RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。
Grok 4.7 AI 模型现在可在 Devin Desktop 和 Devin CLI 中使用,评估结果显示在困难的后端工程任务上表现出色。
Grok 4.7 已发布,在 Long Horizon Browser Use Benchmark v2 上相比 Grok 4.6 性能有所提升,但仍显著落后于 DeepSeek V4.1 Flash 和 GPT-6 Astra。
Codos推出虚拟首席AI官,通过部署公司级记忆和自动化代理来解决前置部署工程师的上下文丢失问题,初步基准测试显示在EnterpriseRAG-Bench上表现优异。
StepFun 的新 Step 5 Preview 模型作为编程代理进行了测试,展示了与 GLM 5.3 等模型相当的性能,并在长期任务中表现出色,这得益于其有效的停止机制。
在本地 Qwen 模型的提示中切换问题与上下文的顺序,使决策基准测试的准确率从 89% 提升至 100%,延迟从约 400 毫秒降至约 80 毫秒。
TypeSafe AI推出了其Jev模型,声称没有幻觉且概率经过校准,但文章质疑校准缺乏公开证据,同时指出开发者快速采用。
CAISI的评估发现,Z.ai的GLM-5.3是目前网络能力最强的开放权重AI模型,但在能力上仍然落后于U.S.前沿模型大约四个月。
关于AI代理在代码编辑任务中的实验表明,当错误已经修复时,代理经常过度编辑代码,性能根据任务指令而变化。使用真实仓库的基准测试突出了代理在软件开发中的行为问题。
OpenMAS-GCom 通过使用受控干预措施,引入了一个用于评估图增强多智能体系统的诊断基准,将性能差异归因于特定的组织组件。
论文表明,AI代理之间的测试时通信能够在像ARC-AGI-3这样的挑战性任务上显著优于独立并行尝试,在面向研究的领域取得最先进的成果。
本文介绍了 BI-Bench,首个用于评估 LLMs 在端到端商业智能任务上表现的基准,以及 BI-Agent,一个工具增强的智能体,它分解工作流并通过后训练显著提高准确性。
本文介绍了一个数据集和基准测试,用于评估大型语言模型对中文竞争性辩论的理解,包括148场比赛,由专业评审,并涉及比赛、阶段和发言者层面的任务。
本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。
本文介绍了μ²-Bench,这是一个用于评估大型语言模型中多语言机器遗忘的基准,旨在确保在不同语言中有效移除不需要的信息。
MME-Safety 是一个经过严格验证的基准,用于评估多模态大语言模型的安全性,具有四维标注框架和一个分层框架,以评估风险场景、危害严重程度和特定模态的隐蔽性水平。