ai-benchmarks

标签

Cards List
#ai-benchmarks

Google Gemini 4 在 Artificial Analysis 基准测试中与 GPT 6 Astra 得分持平,且成本低 40%。

Reddit r/singularity ↗ · 4小时前

Google 的 Gemini 4 在 Artificial Analysis 基准测试中与 GPT 6 Astra 得分持平,而成本低 40%,凸显了其性价比优势。

0 人收藏 0 人点赞
#ai-benchmarks

大语言模型帕累托前沿按基准测试类别划分,Sonnet 5.5 将最后几个 OpenAI 模型挤出前沿边界

Reddit r/ArtificialInteligence ↗ · 2天前 缓存

本文讨论了在各项基准测试类别中,AI 模型在帕累托前沿上的排名情况,重点介绍了 Claude Sonnet 5.5 如何改善了 Anthropic 的地位,并在质量、价格和速度方面将部分 OpenAI 模型挤出了前沿边界。

0 人收藏 0 人点赞
#ai-benchmarks

@wenhaocha1:帕累托前沿对普通用户来说具有误导性。应该按订阅价格而不是 API 来计价。在缓存命中的情况下,Opus 5.5……

X AI KOLs Timeline ↗ · 2天前 缓存

作者认为帕累托前沿基准测试对普通用户具有误导性,并声称如果按订阅而非 API 价格进行比较(在缓存命中的情况下),使用 Claude Code 20 倍用量的 Opus 5.5 优于所有其他模型。

0 人收藏 0 人点赞
#ai-benchmarks

HARDEN: 约束进化搜索用于更难且答案保留的评估案例

arXiv cs.AI ↗ · 2天前 缓存

HARDEN 引入约束进化搜索,以生成更难且保留预期输出的语言模型评估案例,从而在多个基准测试中显著降低了准确性。

0 人收藏 0 人点赞
#ai-benchmarks

Benchy:迈向面向任务的AI基准测试的通用语言

arXiv cs.AI ↗ · 2天前 缓存

Benchy 引入了一种语义语言和执行引擎,用于基准测试AI程序,通过规范表示来标准化基准测试的定义和执行。

0 人收藏 0 人点赞
#ai-benchmarks

WideSWE: 编码代理能否协调跨仓库的更改?

Hugging Face Daily Papers ↗ · 4天前 缓存

论文介绍了WideSWE,这是一个用于评估编码代理在跨仓库任务上的基准,基于120个真实世界任务,表明代理的成功率各异,联合执行可以提升性能。

0 人收藏 0 人点赞
#ai-benchmarks

@charliermarsh: 我担心基准测试与实际能力之间的差距正在扩大

X AI KOLs Timeline ↗ · 4天前 缓存

一次Twitter讨论凸显了日益增长的担忧:AI基准测试未能反映现实世界中模型的能力,因为它们测试的是孤立的任务,而非用户遇到的复杂、长期运行的提示。

0 人收藏 0 人点赞
#ai-benchmarks

检测 Nerf?

Reddit r/singularity ↗ · 4天前

内容讨论了 AI 模型在初始兴奋后性能随时间退化这一常见问题,并质疑是否进行了纵向基准研究以追踪不同模型和实验室的趋势。

0 人收藏 0 人点赞
#ai-benchmarks

@cline: Gemini 3.8 Flash 在 Cline 中免费。它在 Artificial Analysis Intelligence Index 上得分为41,是所有模型中最高的…

X AI KOLs Timeline ↗ · 6天前 缓存

Gemini 3.8 Flash 在 Cline 中免费可用,在 Artificial Analysis Intelligence Index 上得分为41,在其价格层级中最高,并且优于 GPT-5.6 Luna 和 DeepSeek v4.1 Flash 等模型。

0 人收藏 0 人点赞
#ai-benchmarks

是什么让 Terminal-Bench 任务变得困难?在经裁决的智能体语料库上区分真实难度与虚假难度

arXiv cs.LG ↗ · 6天前 缓存

本文探讨了为什么像 Terminal-Bench 这样的智能体 AI 基准测试中的任务可能无法解决,区分了真正的困难与诸如损坏的预言机或基础设施故障等问题,并强调了为准确的能力声明验证所有失败任务的必要性。

0 人收藏 0 人点赞
#ai-benchmarks

有人能解释一下为什么我们认为90%以上的基准被视为饱和吗?

Reddit r/ArtificialInteligence ↗ · 2026-09-23

本文质疑为什么AI基准测试在90%以上准确率时被视为饱和,并主张瞄准100%或开发新的基准。

0 人收藏 0 人点赞
#ai-benchmarks

@browser_use:浏览器使用基准测试 v2 帕累托前沿今日完全重塑 > Claude Opus 5.5:59.4 > GPT‑6 Sol medium:66.9 (3.5...

X AI KOLs Following ↗ · 2026-09-23 缓存

浏览器使用基准测试 v2 更新了其帕累托前沿,展示了来自 OpenAI 的 GPT-6 模型在性能和成本效益上均超越了来自 Anthropic 的 Claude Opus 5.5。

0 人收藏 0 人点赞
#ai-benchmarks

即时记忆:学习为LLM代理策展任务自适应记忆

Hugging Face Daily Papers ↗ · 2026-09-23 缓存

本文介绍了即时记忆(JitMem),一种为LLM代理设计的方法,它将记忆策展推迟到读取时以实现任务自适应负载,展示了在ALFWorld和WebShop等基准测试中相对于基线方法的显著性能提升。

0 人收藏 0 人点赞
#ai-benchmarks

@anshnanda: 当前的基准测试不再适用于新模型。这就是我们看到这样的结果的原因。

X AI KOLs Timeline ↗ · 2026-09-22 缓存

@anshnanda的推文指出,现有的AI基准测试不适合评估新模型,这解释了模型性能中出现意外结果的原因。

0 人收藏 0 人点赞
#ai-benchmarks

基准测试:Grok 4.7, GPT 6, Astra Fable 4.1 和 DeepSeek V4.1 Flash

Reddit r/artificial ↗ · 2026-09-21

发布最新AI模型的全面基准测试,包括Grok 4.7、GPT 6、Astra Fable 4.1和DeepSeek V4.1 Flash,以提供公正的比较。

0 人收藏 0 人点赞
#ai-benchmarks

我刚刚意识到 Felony Bench 其实并不是衡量 AI 智能的好方法...

Reddit r/singularity ↗ · 2026-09-19

这篇文章批评 Felony Bench 作为衡量 AI 智能的不足之处,指出只有被抓到的 AI 才被包括在内,并强调了 Google 的 Gemini 在其黑客能力方面的突出表现。

0 人收藏 0 人点赞
#ai-benchmarks

到达还是解决?用检查点交接归因代理强化学习的收益

arXiv cs.AI ↗ · 2026-09-18 缓存

本文介绍了检查点交接协议,用于归因代理强化学习中的收益,通过分离'到达'(到达有用状态)和'解决'(从那些状态解决),表明RL改进源自这两个组成部分。

0 人收藏 0 人点赞
#ai-benchmarks

@charliermarsh: 这些报告中有很多好的例子。例如:在DeepSWE v1.1中,验证器会丢弃智能体对某些…

X AI KOLs Following ↗ · 2026-09-18 缓存

Epoch AI 推出了 Benchmark Reviews,用于审计 AI 基准测试,揭示了 DeepSWE v1.1 等案例中验证器在不通知模型的情况下丢弃更改,导致失败的缺陷。

0 人收藏 0 人点赞
#ai-benchmarks

我能够复现AI基准测试,但仍然无法验证业务声明。

Reddit r/artificial ↗ · 2026-09-17

一位研究人员复现了AI基准测试,但发现由于指标聚合和模型集成问题,验证业务声明具有挑战性,强调了对AI性能声明进行仔细审查的必要性。

0 人收藏 0 人点赞
#ai-benchmarks

Benchmark Radar:一个面向AI基准测试和评估的动态数据库与搜索引擎

arXiv cs.AI ↗ · 2026-09-12 缓存

Benchmark Radar引入了一个用于AI基准测试的动态数据库和搜索引擎,使研究人员能够跨各种AI领域发现、检索和分析评估资源。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈