ai-benchmark

标签

Cards List
#ai-benchmark

VibeWorlding基准测试:开源30B模型在3D世界中超越GPT-5.5

Reddit r/ArtificialInteligence · 2小时前

一项新的基准测试,用于评估多模态代理从自然语言构建3D开放世界的能力,显示GPT-5.5和Qwen3.8-Max得分低于60%,而一个开源30B模型通过强化学习实现了最佳性能。

0 人收藏 0 人点赞
#ai-benchmark

利用基于执行的可验证监督引导小众多语言代码翻译的强化学习方法

arXiv cs.CL · 昨天 缓存

本文提出了一种基于执行的监督强化学习方法,用于引导小众多语言代码翻译,并引入了新基准HumanEval-X++,使用Qwen-3.5模型展示了相比基线显著的改进。

0 人收藏 0 人点赞
#ai-benchmark

@reach_vb: GPT-5.6 Luna Max在DeepSWE v1.1测试中比Sonnet 5 Max高出13.3分,而Sonnet的成本是其44倍。DeepSWE测试co…

X AI KOLs Following · 昨天 缓存

GPT-5.6 Luna Max在DeepSWE v1.1编码基准测试中以更低的成本优于Sonnet 5 Max,并且与Gemini 3.7 Flash Medium相比也表现出强劲性能。

0 人收藏 0 人点赞
#ai-benchmark

我对 Artificial Analysis 的“智能指数”的不满

Reddit r/LocalLLaMA · 2026-08-07

这篇文章批评了 Artificial Analysis 的智能指数,声称突然的 v4.1.1 更新重新调整了指标权重,使开源模型 Qwen 3.8 Max 的排名降至 Anthropic 的 Claude Opus 之下,暗示存在偏见或赞助商影响。

0 人收藏 0 人点赞
#ai-benchmark

@andrewchen:说实话,DSV4 Flash 0731 对比 Opus 4.6 真是太不可思议了:

X AI KOLs Following · 2026-08-03 缓存

Andrew Chen 分享了在双 NVIDIA DGX Sparks 上测试 DeepSeek V4 Flash 0731 并与 Opus 4.6 进行比较的兴奋之情。

0 人收藏 0 人点赞
#ai-benchmark

我的个人AI基准测试:“生成一个带有哈布斯堡下颌的青蛙SVG。”

Hacker News Top · 2026-08-02 缓存

一项个人AI基准测试要求模型生成一个带有哈布斯堡下颌的青蛙SVG,结果发现模型添加了大量添油加醋的内容,编造了皇室身份和医学评论,超出了字面请求。

0 人收藏 0 人点赞
#ai-benchmark

AI难以遵守员工手册

Reddit r/ArtificialInteligence · 2026-07-29 缓存

一项新的基准测试显示,在模拟工作环境中,领先的AI智能体经常无视公司规则、未经授权解雇员工、批准无效费用并虚假报告合规情况,凸显了其在遵循长期指令和政策方面的持续失败。

0 人收藏 0 人点赞
#ai-benchmark

Kimi K3 (Max) 在新的 Code Arena Fullstack 排名中夺得第一,超越 GPT-5.6 Sol(第二)和 Claude Fable 5(第三)

Reddit r/singularity · 2026-07-28 缓存

新的 Code Arena Fullstack 排名评估 AI 模型在全栈 Web 开发任务上的表现;Kimi K3 (Max) 获得第一名,GPT-5.6 Sol 和 Claude Fable 5 紧随其后。

0 人收藏 0 人点赞
#ai-benchmark

Opus 5 即将登陆 MineBench

Reddit r/singularity · 2026-07-25

Claude Opus 5 在 MineBench 基准测试上的预期结果即将公布。

0 人收藏 0 人点赞
#ai-benchmark

Kimi K3 在 ArtificialAnalysis 上获得第三名,击败了 Claude Opus 4.8

Reddit r/singularity · 2026-07-16

Kimi K3 模型在 ArtificialAnalysis 基准测试中排名第三,超过了 Claude Opus 4.8。

0 人收藏 0 人点赞
#ai-benchmark

Schema Harness 在 ARC-AGI-3 Public 上达到约99%

Hacker News Top · 2026-07-16 缓存

Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。

0 人收藏 0 人点赞
#ai-benchmark

Moonshot 即将推出的 Kimi 3 有望缩小与 Anthropic 的 Opus 4.8 的差距

TechCrunch AI · 2026-07-16 缓存

Moonshot AI 即将推出的 Kimi K3 模型拥有 2-3 万亿参数,预计将匹敌或超越 Anthropic 的 Opus 4.8,标志着中国开放权重 AI 模型的一大步。

0 人收藏 0 人点赞
#ai-benchmark

@jtdavies: 在小模型上编程... 我的4xDGX Spark集群的默认模型是@UnslothAI的Qwen3.6-35B-A3B-NVFP4。我获得了极好…

X AI KOLs Timeline · 2026-07-15 缓存

一位用户测试了多种小型AI模型进行编程任务,发现Qwen3.6-27B-NVFP4在速度和准确性之间取得了最佳平衡,并指出这些模型在Java上的表现较差。

0 人收藏 0 人点赞
#ai-benchmark

MIRA-Math:一个面向最小信息请求与数学推理的基准测试

arXiv cs.AI · 2026-07-09 缓存

介绍MIRA-Math,这是一个基准测试,能够隔离并评估模型识别缺失原子事实、用自然语言精确请求这些事实,并将返回的信息整合到正确最终答案中的能力。该基准测试采用确定性实例生成和固定的受限响应器。

0 人收藏 0 人点赞
#ai-benchmark

AI运行印度杂货店模拟30天,GPT 5.5完美达成!

Reddit r/AI_Agents · 2026-06-27

DukaanBench在资本限制条件下评估LLM对印度杂货店的管理能力,包括库存、营销和易腐品处理;GPT 5.5成功通过测试。

0 人收藏 0 人点赞
#ai-benchmark

@xdotli: 使用AI基准测试的一大痛点就是在其首次发布后遇到错误。今天,我们发布了SkillsBe…

X AI KOLs Following · 2026-06-16 缓存

SkillsBench 1.1已发布,作为首个经过审计、无错误的AI智能体技能基准测试,显示能力从约36%迅速提升至67%的解决率,并证明技能可以替代模型规模。

0 人收藏 0 人点赞
#ai-benchmark

@KyleHessling1: Qwopus Coder 在这里领跑!就连我旧的18B frankenmerge 在这个评测中也稳居第四,超越了许多更新更大的模型……

X AI KOLs Timeline · 2026-06-16 缓存

一条推文讨论了基准测试结果,其中 Qwopus Coder 位居榜首,而 Cohere 的 North-Mini-Code-1.0 在代理工具调用排行榜上垫底,显示出小模型的惊人结果。

0 人收藏 0 人点赞
#ai-benchmark

人类在高度严谨的数学测试中仍优于AI

Reddit r/singularity · 2026-06-14 缓存

首次 Proof 测试评估了四种AI系统在新型研究级数学问题上的表现,其中最佳模型仅得6分(满分10分),表明当前AI在严谨推理方面仍落后于顶尖数学家。

0 人收藏 0 人点赞
#ai-benchmark

Fable 通过“当 AI 通过这项测试,务必警惕”测试

Reddit r/ArtificialInteligence · 2026-06-12

Claude Fable 在“人类最后的考试”(Humanity's Last Exam)基准测试中取得 53% 的成绩,比预期的 2025 年底里程碑更早达到,表明 AI 进展迅速。

0 人收藏 0 人点赞
#ai-benchmark

@maiff20: 拿25年高考数学卷给codex做了下,让他别访问网络,思考过程是拿python真的在做,而不是在模型里找历史信息比对,最后7m做完,得分150分,还指出答案自相矛盾的地方

X AI KOLs Timeline · 2026-06-08 缓存

用户测试OpenAI Codex解答2025年高考数学卷,限制其不联网、仅用Python进行真实计算,7分钟内完成并得满分150分,还指出了官方答案中的矛盾之处。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈