benchmark

标签

Cards List
#benchmark

SCoR:一种用于预测科学概念之间关系的层次框架

arXiv cs.CL ↗ · 6天前 缓存

本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。

0 人收藏 0 人点赞
#benchmark

想象力源于幻觉吗?大型语言模型中想象力与幻觉的跨分类评估

arXiv cs.CL ↗ · 6天前 缓存

论文介绍了Whiteboard,这是首个通过交叉参考幻觉来评估大型语言模型想象力的基准测试,并在79个最先进的LLMs中揭示了两者之间反直觉的负相关。

0 人收藏 0 人点赞
#benchmark

HARMONY: 用于单目图像到场景合成的分层代理推理

Hugging Face Daily Papers ↗ · 6天前 缓存

HARMONY是一个开源框架,利用分层代理推理和VLMs从单张室内图像重建组合式3D场景,在视觉质量上与GPT-6 Astra竞争,并在几何对齐上表现更优。

0 人收藏 0 人点赞
#benchmark

RoboFollow:揭示具身代理中的指令跟随幻觉

Hugging Face Daily Papers ↗ · 6天前 缓存

RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。

0 人收藏 0 人点赞
#benchmark

最终基准测试

Reddit r/singularity ↗ · 6天前

本文提出了一项权威基准测试,旨在评估和比较AI模型或系统,并为未来的评估确立标准。

0 人收藏 0 人点赞
#benchmark

@devindesktop: Grok 4.7 现在已在 Devin Desktop 和 Devin CLI 中可用!

X AI KOLs Following ↗ · 6天前 缓存

Grok 4.7 AI 模型现在可在 Devin Desktop 和 Devin CLI 中使用,评估结果显示在困难的后端工程任务上表现出色。

0 人收藏 0 人点赞
#benchmark

@browser_use: Grok 4.7 刚刚发布。仍在追赶 DeepSeek Long Horizon Browser Use Benchmark v2 > GPT-6 Astra:80.6 > DeepSeek V4.1…

X AI KOLs Timeline ↗ · 6天前 缓存

Grok 4.7 已发布,在 Long Horizon Browser Use Benchmark v2 上相比 Grok 4.6 性能有所提升,但仍显著落后于 DeepSeek V4.1 Flash 和 GPT-6 Astra。

0 人收藏 0 人点赞
#benchmark

@rohanpaul_ai: 前置部署工程师面临复合问题:他们花费数月学习公司系统和隐藏依赖……

X AI KOLs Timeline ↗ · 2026-09-21 缓存

Codos推出虚拟首席AI官,通过部署公司级记忆和自动化代理来解决前置部署工程师的上下文丢失问题,初步基准测试显示在EnterpriseRAG-Bench上表现优异。

0 人收藏 0 人点赞
#benchmark

@omarsar0: StepFun 的新 Step 5 Preview 模型令人印象深刻!有机会提前测试了一下。我一直在将它作为编程代理进行测试…

X AI KOLs Following ↗ · 2026-09-21 缓存

StepFun 的新 Step 5 Preview 模型作为编程代理进行了测试,展示了与 GLM 5.3 等模型相当的性能,并在长期任务中表现出色,这得益于其有效的停止机制。

0 人收藏 0 人点赞
#benchmark

将问题置于上下文之前,使我的本地 Qwen 模型在决策基准测试中的准确率从 89% 提升至 100%,延迟从约 400 毫秒降至约 80 毫秒

Reddit r/LocalLLaMA ↗ · 2026-09-21

在本地 Qwen 模型的提示中切换问题与上下文的顺序,使决策基准测试的准确率从 89% 提升至 100%,延迟从约 400 毫秒降至约 80 毫秒。

0 人收藏 0 人点赞
#benchmark

TypeSafe的Jev无法生成无效输出,但其校准声明未附带ECE或可靠性曲线

Reddit r/ArtificialInteligence ↗ · 2026-09-21

TypeSafe AI推出了其Jev模型,声称没有幻觉且概率经过校准,但文章质疑校准缺乏公开证据,同时指出开发者快速采用。

0 人收藏 0 人点赞
#benchmark

CAISI对Z.ai的GLM-5.3网络能力的评估

Reddit r/ArtificialInteligence ↗ · 2026-09-21 缓存

CAISI的评估发现,Z.ai的GLM-5.3是目前网络能力最强的开放权重AI模型,但在能力上仍然落后于U.S.前沿模型大约四个月。

0 人收藏 0 人点赞
#benchmark

在一个为诱使代理而构建的页面上进行十五次“让一个按钮变蓝”的运行,每次都停留在一个选择器内;一个包含200个任务的陈旧错误基准测试显示,真实仓库在35%到65%的情况下走向另一条路

Reddit r/AI_Agents ↗ · 2026-09-21

关于AI代理在代码编辑任务中的实验表明,当错误已经修复时,代理经常过度编辑代码,性能根据任务指令而变化。使用真实仓库的基准测试突出了代理在软件开发中的行为问题。

0 人收藏 0 人点赞
#benchmark

OpenMAS-GCom:图增强多智能体系统的诊断基准

arXiv cs.LG ↗ · 2026-09-21 缓存

OpenMAS-GCom 通过使用受控干预措施,引入了一个用于评估图增强多智能体系统的诊断基准,将性能差异归因于特定的组织组件。

0 人收藏 0 人点赞
#benchmark

通过测试时通信扩展发现

arXiv cs.LG ↗ · 2026-09-21 缓存

论文表明,AI代理之间的测试时通信能够在像ARC-AGI-3这样的挑战性任务上显著优于独立并行尝试,在面向研究的领域取得最先进的成果。

0 人收藏 0 人点赞
#benchmark

BI-Agent 和 BI-Bench:迈向自动化端到端商业智能

arXiv cs.LG ↗ · 2026-09-21 缓存

本文介绍了 BI-Bench,首个用于评估 LLMs 在端到端商业智能任务上表现的基准,以及 BI-Agent,一个工具增强的智能体,它分解工作流并通过后训练显著提高准确性。

0 人收藏 0 人点赞
#benchmark

中文辩论数据集与基准测试

arXiv cs.CL ↗ · 2026-09-21 缓存

本文介绍了一个数据集和基准测试,用于评估大型语言模型对中文竞争性辩论的理解,包括148场比赛,由专业评审,并涉及比赛、阶段和发言者层面的任务。

0 人收藏 0 人点赞
#benchmark

Omni Demand Understanding: 多模态交互中上下文用户意图推理的基准测试

arXiv cs.CL ↗ · 2026-09-21 缓存

本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。

0 人收藏 0 人点赞
#benchmark

μ²-Bench:一个多语言机器遗忘基准

arXiv cs.CL ↗ · 2026-09-21 缓存

本文介绍了μ²-Bench,这是一个用于评估大型语言模型中多语言机器遗忘的基准,旨在确保在不同语言中有效移除不需要的信息。

0 人收藏 0 人点赞
#benchmark

MME-Safety:一个用于MLLMs安全评估的细粒度基准

arXiv cs.CL ↗ · 2026-09-21 缓存

MME-Safety 是一个经过严格验证的基准,用于评估多模态大语言模型的安全性,具有四维标注框架和一个分层框架,以评估风险场景、危害严重程度和特定模态的隐蔽性水平。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈