ai-benchmarking

标签

Cards List
#ai-benchmarking

Hyper-τ-bench: 评估构建代理的代理(4分钟阅读)

TLDR AI · 2天前 缓存

Sierra AI 开源了 Hyper-τ-bench,这是一个新的基准测试,用于评估AI模型构建客户服务代理的能力,揭示了自主构建的局限性以及在人类协助下的改进。

0 人收藏 0 人点赞
#ai-benchmarking

两块RTX 4090实际能同时运行多少个代理?三周的llama.cpp并发数据——软上限5 @ 64k,硬上限9,以及原因。

Reddit r/LocalLLaMA · 2天前

关于在两块RTX 4090 GPU上使用llama.cpp并发运行多个AI代理的基准测试报告,揭示了性能限制和Qwen模型的最佳配置。

0 人收藏 0 人点赞
#ai-benchmarking

Artificial Analysis 更新其 Intelligence Index 至 4.3 版本

Reddit r/singularity · 3天前 缓存

Artificial Analysis 已将其 Intelligence Index 更新至 4.3 版本,新增了 Terminal-Bench v4.0 和 AutomationBench-AA 等基准测试,以更好地评估 AI 模型的性能和成本效率。

0 人收藏 0 人点赞
#ai-benchmarking

Astra相关误导性基准报告的普遍问题

Reddit r/singularity · 2026-09-03

OpenAI对Astra在ARC-AGI-3上的基准报告具有误导性,因为它使用了不同的测试环境,并且在标准条件下,性能差距没有那么显著。

0 人收藏 0 人点赞
#ai-benchmarking

@rohanpaul_ai: 如果管理工作的模型不知道何时重定向、验证或停止,那么强大的编码模型也是不够的。Loop…

X AI KOLs Following · 2026-09-03 缓存

LoopArena 将模型作为编码任务的运行时控制器进行基准测试,揭示即使 GPT-5.5 也仅达到 24.69% 的成功率,强调了代理系统中需要更好的控制机制。

0 人收藏 0 人点赞
#ai-benchmarking

展示 HN:FrontierHarness Eval – 9个测试框架,相同模型,每次通过成本差异最高达17倍

Hacker News Top · 2026-09-02 缓存

FrontierHarness Eval 对九个软件工程测试框架在单一模型上进行基准测试,表明根据所使用的测试框架,每个成功任务的成本差异最高可达17倍。

0 人收藏 0 人点赞
#ai-benchmarking

Qwen3.8-Flash-Next-NVFP4 对比 Qwen3.8-27B-FP 测试结果

Reddit r/LocalLLaMA · 2026-08-31

本文详细测试了Qwen3.8-Flash-Next-NVFP4与Qwen3.8-27B-FP8两款AI模型在各类任务中的性能表现,结果显示Flash-Next版本在速度与失败率方面更具优势,但在处理多步骤符号任务时表现较弱。

0 人收藏 0 人点赞
#ai-benchmarking

我如何在不平均不兼容分数的情况下组合11个编码基准测试

Reddit r/ArtificialInteligence · 2026-08-30

作者描述了一种通过组合11个基准测试来比较编码AI模型的方法,使用百分位排名而不是平均原始分数,重点是对98个模型进行去重和加权类别。

0 人收藏 0 人点赞
#ai-benchmarking

Qwen3.8-27B 思考模式 xhigh 与关闭思考模式 - Apple M5 Max

Reddit r/LocalLLaMA · 2026-08-29

在MacBook Pro M5 Max上的基准测试显示,禁用Qwen3.8-27B的思考模式会严重降低输出质量,而xhigh思考模式则使用5.5倍更多的令牌并运行6倍更长时间。

0 人收藏 0 人点赞
#ai-benchmarking

本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实测数据

Hacker News Top · 2026-08-28 缓存

本文提供了在 Mac Studio 上本地运行 Qwen3.8 27B AI 模型的实际性能基准测试,将其与前代模型进行比较,并讨论了硬件要求和量化效果。

0 人收藏 0 人点赞
#ai-benchmarking

技术性比较基准研究:用于可再生能源农场优化与预测的先进AI混合方法

arXiv cs.LG · 2026-08-28 缓存

这项比较基准研究评估了多种用于可再生能源农场优化与预测的AI方法,表明集成方法和混合方法在不同数据场景下表现出色。

0 人收藏 0 人点赞
#ai-benchmarking

“不太可能”有多不可能?评估大型语言模型对言语概率的感知

arXiv cs.CL · 2026-08-28 缓存

本文对大型语言模型如何解释言语概率表达式进行了系统性的跨模型评估,发现它们能够忠实追踪人类基准,但存在偏差,尤其是在负面表达方面,这对人类与AI之间的不确定性交流有影响。

0 人收藏 0 人点赞
#ai-benchmarking

AI能否让其他AI变得更优秀?我们测试了5个前沿LLM在重写其他代理框架的能力,评分基于它们从未见过的测试集(HarnessOpt-Bench,arXiv + MIT代码)

Reddit r/artificial · 2026-08-27

文章介绍了HarnessOpt-Bench,一个评估LLM改进其他AI代理框架能力的基准测试,并基于5个前沿模型的研究结果,指出模型选择对性能的影响大于框架选择。

0 人收藏 0 人点赞
#ai-benchmarking

@rohanpaul_ai: 企业AI的昂贵之处往往在于为任务使用过多的智能。Glean正将这一决策移入…

X AI KOLs Following · 2026-08-26 缓存

Glean引入运行时智能决策,将企业AI token成本降低81%,在基准测试中超越Claude,并宣布新功能如Glean Tau和自动路由。

0 人收藏 0 人点赞
#ai-benchmarking

忘掉鹈鹕,迎来象鼻虫时代! / 防基准测试过度的 SVG 和视觉基准测试

Reddit r/LocalLLaMA · 2026-08-26

本文介绍了使用不同量化和设置测试 Qwen3.8-27B AI 模型,以将其图像重建为 SVG,目标是创建一个能抵御基准测试过度优化的基准。初步结果显示,高推理强度和特定的缓存配置能提升性能。

0 人收藏 0 人点赞
#ai-benchmarking

被低估的 Muse Glimmer

Reddit r/LocalLLaMA · 2026-08-26

基准测试结果显示,Muse Glimmer 在隐式知识测试中出人意料地超越了 qwen3.8,这表明较小的模型通过 RAG 增强可以实现有竞争力的性能。

0 人收藏 0 人点赞
#ai-benchmarking

PhysicsBench:工程设计和仿真中生成式与预测模型的统一排行榜

arXiv cs.LG · 2026-08-26 缓存

PhysicsBench引入了一个统一的基准测试和排行榜,以标准化工程设计和仿真中生成式与预测AI模型的评估,涵盖多种任务和数据规模。

0 人收藏 0 人点赞
#ai-benchmarking

Gemini 3.7 Flash 在 OpenRouter 上目前打75折,在性价比上击败了 DeepSeek。

Reddit r/singularity · 2026-08-22

根据 Artificial Analysis 的数据,Google 将 OpenRouter 上的 Gemini 3.7 Flash 降价75%,使其更便宜,并在性价比上超越了 DeepSeek 模型。

0 人收藏 0 人点赞
#ai-benchmarking

我在SWE-bench Verified Mini(50个任务)上基准测试了Ox Alpha:96%的问题已解决。现在我对自己产生了怀疑。

Reddit r/LocalLLaMA · 2026-08-21

作者在SWE-bench Verified Mini上对Ox Alpha进行了基准测试,达到了96%的解决率,但对分数的有效性提出了担忧,原因包括数据污染、小样本量和不可比较的基线。

0 人收藏 0 人点赞
#ai-benchmarking

Qwen 3.8 进入大学。ACT 得分 34

Reddit r/AI_Agents · 2026-08-20

一项实验测试了 Qwen 3.8 27B AI 模型在使用视觉能力进行 ACT 模拟考试时的表现,取得了 34-36 分的高综合分,展示了在标准化测试中的强大性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈