model-performance

标签

Cards List
#model-performance

终端基准测试V4评分

Reddit r/LocalLLaMA · 10小时前

终端基准测试V4评分显示,GLM-5.3在开源模型中领先,GLM-5.3-Flash在轻量模型中位居榜首,而Kimi-K3表现不佳。该基准被部分人士认为更能反映模型智能水平。

0 人收藏 0 人点赞
#model-performance

GPT-6 Astra 在 ChessBench 上达到2,340 Elo,排名第11

Reddit r/singularity · 14小时前 缓存

ChessBench AI国际象棋排行榜已更新,包含了新模型的表现,例如 GPT-6 Astra 达到2,340 Elo并排名第11,以及Claude Fable 5.1和Gemini 3.8 Flash等其他模型。

0 人收藏 0 人点赞
#model-performance

GPT 6 Astra 以纯视觉框架在22小时内通关Fallout 2

Reddit r/singularity · 2026-09-04

GPT-6 Astra 使用纯视觉框架在22小时内完成了Fallout 2。Clad3815 以AI直播Pokémon游戏而闻名,并提前获得了该模型的使用权。

0 人收藏 0 人点赞
#model-performance

@JinjingLiang: Codex、Claude、Grok 全部宕机。从未想象到 `agy` 如此关键...

X AI KOLs Timeline · 2026-09-03 缓存

该帖子突出了 Gemini 3.8 Flash 在 DeepSWE-bench 上优于 Opus 5 的性能,强调其在编码和代理任务方面的能力,并指出其通过 Orca 中的 `agy` 框架可用。

0 人收藏 0 人点赞
#model-performance

Simple Bench - QWEN 3.8 27b 几乎拥有与 GPT 5.0 Pro 相似的常识能力??

Reddit r/singularity · 2026-09-03

一项名为 Simple Bench 的基准测试表明,QWEN 3.8 27b 模型具有几乎可与 GPT 5.0 Pro 相媲美的常识能力。

0 人收藏 0 人点赞
#model-performance

@ArizePhoenix: 它现在以84.5%领先CyberGym,https://Z.ai正在运行一个公开披露账本,用于2,400多个现实世界漏洞…

X AI KOLs Following · 2026-09-03 缓存

一个AI模型在CyberGym上取得了84.5%的成绩,领先基准,Z.ai正在运行一个公开披露账本,用于该模型揭示的超过2,400个现实世界漏洞。

0 人收藏 0 人点赞
#model-performance

所有当前流行本地模型一览表 + Opus 4.8 测试结果

Reddit r/LocalLLaMA · 2026-09-01

本文提供了一份流行本地AI模型的对比表格,涵盖代理、编码、通用和多模态任务等各种基准测试,以帮助用户根据硬件规格和用例选择模型。

0 人收藏 0 人点赞
#model-performance

@rohanpaul_ai: 另一个例子表明,框架本身,而非模型,决定了智能能达到的程度。通过API……

X AI KOLs Timeline · 2026-08-28 缓存

这条推文突出了Atomic Agent(一个模型无关的代理层)如何通过执行模型操作和保持状态来提高GLM 5.3的性能,几乎将令牌使用量翻倍,而成本仅增加77美分。

0 人收藏 0 人点赞
#model-performance

@rohanpaul_ai: 这篇论文对长期AI来说是一个残酷的现实检验。给一个智能体一年的相互关联的决策、延迟的反馈…

X AI KOLs Following · 2026-08-28 缓存

一篇论文评估了八个领先的AI模型在长期任务上的表现,发现即使表现最好的模型也只达到了人类表现的27.3%,突显了可靠长期AI执行的重大局限性。

0 人收藏 0 人点赞
#model-performance

Qwen3.8-27b q8 KV缓存似乎确实损害模型性能

Reddit r/LocalLLaMA · 2026-08-28

本文讨论了基于Qwen3.8-27B的实验,如何实时KV缓存量化因累积误差而降低长上下文模型的性能。

0 人收藏 0 人点赞
#model-performance

27b模型击败最新前沿模型,这不在我的2026年预期内

Reddit r/LocalLLaMA · 2026-08-26

用户分享了一个27b AI模型击败最新前沿模型的经验,并提供了个人对Qwen 3.8在智能体任务和Qwen 3.7 flash在整体任务上的使用体验。

0 人收藏 0 人点赞
#model-performance

Qwen 3.8 27B Aider 得分

Reddit r/LocalLLaMA · 2026-08-24

用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。

0 人收藏 0 人点赞
#model-performance

@narens:基准测试巅峰

X AI KOLs Following · 2026-08-23 缓存

在Artificial Analysis的分析师代理基准测试中,Gemini 3.7 flash超越了Fable 5、Opus 5和GPT-5.6。

0 人收藏 0 人点赞
#model-performance

Ox Alpha刚刚完成了完整的DeepSWE运行。最终得分:约63%。供参考:• DeepSeek V4 Pro → 63% • Grok 4.6 → 65% …

X AI KOLs Timeline · 2026-08-23 缓存

Ox Alpha,一个拥有100万上下文的免费模型,在DeepSWE基准测试中获得了约63%的分数,匹配了前沿中端模型,并暗示了本地AI智能体开发的潜力。

0 人收藏 0 人点赞
#model-performance

我在SWE-bench Verified Mini(50个任务)上基准测试了Ox Alpha:96%的问题已解决。现在我对自己产生了怀疑。

Reddit r/LocalLLaMA · 2026-08-21

作者在SWE-bench Verified Mini上对Ox Alpha进行了基准测试,达到了96%的解决率,但对分数的有效性提出了担忧,原因包括数据污染、小样本量和不可比较的基线。

0 人收藏 0 人点赞
#model-performance

在AI生成的低质内容上训练AI模型

Reddit r/ArtificialInteligence · 2026-08-21

本文探讨了利用其他AI系统生成的低质数据(常被称为'AI垃圾')训练AI模型的问题,及其对模型可靠性和性能的影响。

0 人收藏 0 人点赞
#model-performance

@gfodor: 根据我的经验,Anthropic 似乎从未在任何一天拥有过最佳的编码模型。

X AI KOLs Following · 2026-08-20

作者根据自身经验指出,Anthropic 的模型在编码方面并非最佳,但 Claude Code 却被广泛使用,他质疑这种现象的原因。

0 人收藏 0 人点赞
#model-performance

Qwen 3.8 27B SlopCodeBench 测试结果

Reddit r/LocalLLaMA · 2026-08-19

这篇文章展示了 Qwen 3.8 27B 模型在 SlopCodeBench 上的基准测试结果,显示在严格检查点上表现不佳,但在核心检查点上表现尚可,这表明在没有指导的情况下,它可能不适合自主代码管理。

0 人收藏 0 人点赞
#model-performance

@Argona0x: 泄露这件事的人胆子比脑子大。有人在 Anthropic 雇佣了 80 个 AI 助手参与一个项目,给了他们十二个小时……

X AI KOLs Timeline · 2026-08-19 缓存

Anthropic 泄露的一项实验显示,在一个项目中使用 80 个 AI 助手会导致糟糕的结果,除非它们独立工作,较新的模型由于隔离而表现更好。作者建议为每个 AI 助手分配一个单一的、专责的工作以提高生产力。

0 人收藏 0 人点赞
#model-performance

IOL-AI 挑战赛:迈向语言推理进步的开放挑战

arXiv cs.CL · 2026-08-19 缓存

IOL-AI 挑战赛是一项开源科学竞赛,利用国际语言学奥林匹克竞赛2026年的未公开题目来评估AI模型的语言推理能力,结果表明性能更依赖于解码和输出处理而非模型规模。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈