标签
Grok 4.7 AI 模型现在可在 Devin Desktop 和 Devin CLI 中使用,评估结果显示在困难的后端工程任务上表现出色。
Grok 4.7 已发布,在 Long Horizon Browser Use Benchmark v2 上相比 Grok 4.6 性能有所提升,但仍显著落后于 DeepSeek V4.1 Flash 和 GPT-6 Astra。
Codos推出虚拟首席AI官,通过部署公司级记忆和自动化代理来解决前置部署工程师的上下文丢失问题,初步基准测试显示在EnterpriseRAG-Bench上表现优异。
StepFun 的新 Step 5 Preview 模型作为编程代理进行了测试,展示了与 GLM 5.3 等模型相当的性能,并在长期任务中表现出色,这得益于其有效的停止机制。
在本地 Qwen 模型的提示中切换问题与上下文的顺序,使决策基准测试的准确率从 89% 提升至 100%,延迟从约 400 毫秒降至约 80 毫秒。
TypeSafe AI推出了其Jev模型,声称没有幻觉且概率经过校准,但文章质疑校准缺乏公开证据,同时指出开发者快速采用。
CAISI的评估发现,Z.ai的GLM-5.3是目前网络能力最强的开放权重AI模型,但在能力上仍然落后于U.S.前沿模型大约四个月。
关于AI代理在代码编辑任务中的实验表明,当错误已经修复时,代理经常过度编辑代码,性能根据任务指令而变化。使用真实仓库的基准测试突出了代理在软件开发中的行为问题。
OpenMAS-GCom 通过使用受控干预措施,引入了一个用于评估图增强多智能体系统的诊断基准,将性能差异归因于特定的组织组件。
论文表明,AI代理之间的测试时通信能够在像ARC-AGI-3这样的挑战性任务上显著优于独立并行尝试,在面向研究的领域取得最先进的成果。
本文介绍了 BI-Bench,首个用于评估 LLMs 在端到端商业智能任务上表现的基准,以及 BI-Agent,一个工具增强的智能体,它分解工作流并通过后训练显著提高准确性。
本文介绍了一个数据集和基准测试,用于评估大型语言模型对中文竞争性辩论的理解,包括148场比赛,由专业评审,并涉及比赛、阶段和发言者层面的任务。
本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。
本文介绍了μ²-Bench,这是一个用于评估大型语言模型中多语言机器遗忘的基准,旨在确保在不同语言中有效移除不需要的信息。
MME-Safety 是一个经过严格验证的基准,用于评估多模态大语言模型的安全性,具有四维标注框架和一个分层框架,以评估风险场景、危害严重程度和特定模态的隐蔽性水平。
VisPath 引入了一种视觉意图引导的路径推理框架,用于多模态知识图谱问答,在新的基准 VisPath-Bench 和现有数据集上取得了显著改进,超越了基线方法。
PhysioBench引入了一个统一的生理信号问答基准,整合22个数据集成6140万道问题,涵盖30项任务,以评估各种AI模型的性能。
HappyWorld-Bench 是一个全面的基准测试,用于评估世界模型在交互和修改下,在视频、空间和具身赛道中的可靠性。
本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。