benchmark

标签

Cards List
#benchmark

SWE-Bench Pro V2(阅读时间9分钟)

TLDR AI ↗ · 5天前 缓存

SWE-Bench Pro V2是一个更新的基准测试,用于在软件工程中评估AI代理,包含来自11个代码库的642个任务,具有改进的评估协议和污染控制。

0 人收藏 0 人点赞
#benchmark

@jerryjliu0: Opus 5.5 是解析 PDF 表格的最佳前沿模型。我们通过 ParseBench 测试,得分 93.9%,比 Opus 5 提高了 7% 以上…

X AI KOLs Timeline ↗ · 5天前 缓存

Opus 5.5 在 ParseBench 上针对 PDF 表格解析的得分为 93.9%,超越了 Opus 5 和其他模型,但与 LlamaParse 相比成本较高。

0 人收藏 0 人点赞
#benchmark

M5 ultra AI 测试结果

Reddit r/LocalLLaMA ↗ · 5天前

M5 ultra AI 测试结果显示,提示处理速度比 M3 ultra 快 4 到 4.5 倍,令牌生成速度快 1.5 倍,但功耗翻倍,风扇噪音增大,温度更高。

0 人收藏 0 人点赞
#benchmark

LLM Ass Bench

Hacker News Top ↗ · 5天前 缓存

LLM Ass Bench 是一个用于评估大型语言模型的基准测试工具,专注于提示词。

0 人收藏 0 人点赞
#benchmark

Opus 5.5 与 GPT-6 Astra/Sol 的所有基准测试对比

Reddit r/singularity ↗ · 5天前

如图所示,在基准测试对比中,Opus 5.5 的表现优于 GPT-6 Astra 和 Sol,但成本更高。

0 人收藏 0 人点赞
#benchmark

Opus 5.5 在 Terminal-Bench 4.0 上的成本与性能对比

Reddit r/singularity ↗ · 5天前

本文评估了 Opus 5.5 AI 模型在 Terminal-Bench 4.0 基准测试中的成本效益和性能。

0 人收藏 0 人点赞
#benchmark

Claude Opus 5.5 在 Artificial Analysis Intelligence Index 上位居榜首,同时实现20%降价与更大的缓存命中折扣。

Reddit r/ArtificialInteligence ↗ · 5天前

Claude Opus 5.5 已在 Artificial Analysis Intelligence Index 中获得首位,并伴随20%的价格下调和增强的缓存命中优惠。

0 人收藏 0 人点赞
#benchmark

@browser_use: 开源MiMo v2.6模型是新帕累托前沿 > MiMo v2.6 Flash: 37.6 > Grok 4.7的39.9 > 成本低57倍…

X AI KOLs Following ↗ · 5天前 缓存

据称,开源MiMo v2.6模型建立了新的帕累托前沿,在基准测试中成本比Grok 4.7低57倍,比DeepSeek v4.1 Flash便宜27%。

0 人收藏 0 人点赞
#benchmark

LinearSolveBench: 线性求解器的新基准测试 [P]

Reddit r/MachineLearning ↗ · 5天前

LinearSolveBench 是一个用于评估 C 语言线性求解器的新基准测试,重点关注针对大型稀疏系统的速度、精度和通用性,以促进算法进步。

0 人收藏 0 人点赞
#benchmark

Show HN: JevBench,一个用于类型化决策模型的可复现基准测试

Hacker News Top ↗ · 6天前 缓存

JevBench v1.3.0 是一个用于Jev类决策模型的可复现基准测试,基于智能性、校准度、速度和成本对52个系统进行评估和排名。

0 人收藏 0 人点赞
#benchmark

GPT-6 Astra 对决 Anthropic 新模型 Mythos:Pelican SVG 测试

Reddit r/singularity ↗ · 6天前

一条推文对比了 GPT-6 Astra 和 Anthropic 新模型 Mythos 在 Pelican SVG 测试中的表现,并附有外部来源链接。

0 人收藏 0 人点赞
#benchmark

@kentcdodds: 这不是你通常希望看到模型发展的方向

X AI KOLs Timeline ↗ · 6天前 缓存

Cognition 在 Devin 中发布了 Grok 4.7,在 FrontierCode 1.1 Extended 任务上取得了 59.4% 的分数,展示了在后端工程方面的强大性能。

0 人收藏 0 人点赞
#benchmark

MiMo-v2.6-Pro: 智能、性能与价格分析

Hacker News Top ↗ · 6天前 缓存

基于Artificial Analysis的基准和指标对MiMo-v2.6-Pro AI模型的智能、性能与价格进行分析。

0 人收藏 0 人点赞
#benchmark

编码代理能否重现官方统计数据?元数据、重试预算与执行反馈的局限性:一项受控Eurostat基准测试

arXiv cs.LG ↗ · 6天前 缓存

本研究以编码代理重现Eurostat统计数据为基准进行评估,发现语义验证和重试预算对可靠性至关重要,远不止于执行诊断。

0 人收藏 0 人点赞
#benchmark

剖析多模态大语言模型中的免训练不确定性估计

arXiv cs.CL ↗ · 6天前 缓存

一项系统性的基准测试研究,对多模态大语言模型的免训练不确定性量化策略进行评测,将方法分为基于令牌级、语言化和语义的方法,并发现最佳策略取决于响应长度。

0 人收藏 0 人点赞
#benchmark

PII-TRACE:面向多轮LLM对话中上下文感知PII检测的基准测试

arXiv cs.CL ↗ · 6天前 缓存

介绍PII-TRACE,首个用于多轮LLM对话中上下文感知PII检测的基准,以及PII-Tracer,一个实现高实体级覆盖率的紧凑检测器。

0 人收藏 0 人点赞
#benchmark

SCoR:一种用于预测科学概念之间关系的层次框架

arXiv cs.CL ↗ · 6天前 缓存

本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。

0 人收藏 0 人点赞
#benchmark

想象力源于幻觉吗?大型语言模型中想象力与幻觉的跨分类评估

arXiv cs.CL ↗ · 6天前 缓存

论文介绍了Whiteboard,这是首个通过交叉参考幻觉来评估大型语言模型想象力的基准测试,并在79个最先进的LLMs中揭示了两者之间反直觉的负相关。

0 人收藏 0 人点赞
#benchmark

HARMONY: 用于单目图像到场景合成的分层代理推理

Hugging Face Daily Papers ↗ · 6天前 缓存

HARMONY是一个开源框架,利用分层代理推理和VLMs从单张室内图像重建组合式3D场景,在视觉质量上与GPT-6 Astra竞争,并在几何对齐上表现更优。

0 人收藏 0 人点赞
#benchmark

RoboFollow:揭示具身代理中的指令跟随幻觉

Hugging Face Daily Papers ↗ · 6天前 缓存

RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈