artificial-analysis

标签

Cards List
#artificial-analysis

Artificial Analysis "Intelligence": 一个毫无意义的基准测试

Reddit r/LocalLLaMA · 2026-08-22

本文批评了Artificial Analysis Intelligence Index作为一个毫无意义的基准,质疑其在比较像Qwen 27B这样的LLM与更大模型如GPT-5.2和Opus 4.6时的有效性。

0 人收藏 0 人点赞
#artificial-analysis

GLM5.3 Artificial Analysis 基准测试

Reddit r/LocalLLaMA · 2026-08-18 缓存

本文对GLM-5.3人工智能模型进行了详尽的基准分析,评估了其在Artificial Analysis的多项测试中的智能水平与性能表现。

0 人收藏 0 人点赞
#artificial-analysis

Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分

Simon Willison's Blog · 2026-08-17 缓存

在 Simon Willison 的博客文章中强调,Qwen 3.8 27B AI 模型在 Artificial Analysis Intelligence Index 上取得了 52 分。

0 人收藏 0 人点赞
#artificial-analysis

Qwen3.8 27B 在 Artificial Analysis Agentic Index 上优于 Opus 5 Medium

Reddit r/LocalLLaMA · 2026-08-17

Qwen3.8 27B 在 Artificial Analysis Agentic Index 上优于 Opus 5 Medium,凸显了其在代理任务中的强大能力。

0 人收藏 0 人点赞
#artificial-analysis

SpaceXAI的Grok 4.6在Artificial Analysis Intelligence Index中得分61

Hacker News Top · 2026-08-12 缓存

SpaceXAI的Grok 4.6在Artificial Analysis Intelligence Index中得分61,与GPT-5.6 Sol和Claude模型一起跻身前沿,以较低成本展现出强大的智能体性能。

0 人收藏 0 人点赞
#artificial-analysis

我对 Artificial Analysis 的“智能指数”的不满

Reddit r/LocalLLaMA · 2026-08-07

这篇文章批评了 Artificial Analysis 的智能指数,声称突然的 v4.1.1 更新重新调整了指标权重,使开源模型 Qwen 3.8 Max 的排名降至 Anthropic 的 Claude Opus 之下,暗示存在偏见或赞助商影响。

0 人收藏 0 人点赞
#artificial-analysis

Qwen3.8 Max 在智能体指数中被评为最佳整体模型

Hacker News Top · 2026-08-06 缓存

Qwen3.8 Max 目前在 Artificial Analysis 的智能体指数中排名第一,在独立评估中超越了其他领先的AI模型。

0 人收藏 0 人点赞
#artificial-analysis

Qwen 3.8 Max 的 Artificial Analysis 分数

Reddit r/singularity · 2026-08-03

Reddit 帖子分享了 Qwen 3.8 Max 的 Artificial Analysis 分数,称赞它是 Opus 4.7 的廉价替代品。

0 人收藏 0 人点赞
#artificial-analysis

@omarsar0: 我一直说这些模型的token效率被低估了。对这些模型要更有野心。尝试不同……

X AI KOLs Following · 2026-08-01 缓存

Omar认为AI模型的token效率被低估,并引用Artificial Analysis的报告,指出DeepSeek完成基准测试任务的成本比Fable低105倍。

0 人收藏 0 人点赞
#artificial-analysis

我预测 DeepSeek V4 Flash 0731 的 Artificial Analysis 评分为 57 ± 1 分(Kimi K3 水平)

Reddit r/LocalLLaMA · 2026-07-31

有用户基于线性回归预测,DeepSeek V4 Flash 0731 在 Artificial Analysis 上的评分将达到 57±1,与 Kimi K3 水平相当。该帖对其价格下的模型性能表示兴奋。

0 人收藏 0 人点赞
#artificial-analysis

Opus 5 目前在人工智能分析智能排行榜上排名第一

Hacker News Top · 2026-07-24 缓存

Opus 5 已荣登 Artificial Analysis Intelligence Leaderboard 榜首,该排行榜通过多个基准测试评估AI模型,包括 Artificial Analysis Intelligence Index 和 AA-Briefcase。

0 人收藏 0 人点赞
#artificial-analysis

MAI(微软人工智能)在编程方面远远落后

Reddit r/ArtificialInteligence · 2026-07-22

文章批评微软人工智能的编码模型表现逊于Kimi K3和Deepseek V4等竞争对手,暗示尽管资源雄厚,MAI仍远远落后。

0 人收藏 0 人点赞
#artificial-analysis

Kimi K3 在 ArtificialAnalysis 上获得第三名,击败了 Claude Opus 4.8

Reddit r/singularity · 2026-07-16

Kimi K3 模型在 ArtificialAnalysis 基准测试中排名第三,超过了 Claude Opus 4.8。

0 人收藏 0 人点赞
#artificial-analysis

人工智能分析:Muse Spark 1.1 结果

Reddit r/singularity · 2026-07-10

人工智能分析报告了 Muse Spark 1.1 AI 模型的基准测试结果,并提供了性能指标。

0 人收藏 0 人点赞
#artificial-analysis

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity · 2026-07-09 缓存

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。

0 人收藏 0 人点赞
#artificial-analysis

SpaceXAI的Grok 4.5在人工智能分析智能指数中得分54,位列第四

Reddit r/singularity · 2026-07-08

SpaceXAI的Grok 4.5在人工智能分析智能指数上获得54分,排名第四。

0 人收藏 0 人点赞
#artificial-analysis

Claude Sonnet 5 人工分析结果与对比

Reddit r/singularity · 2026-06-30

提供对 Claude Sonnet 5 在各项基准测试中的性能分析和比较。

0 人收藏 0 人点赞
#artificial-analysis

开源权重大语言模型与闭源大语言模型之间的差距

Hacker News Top · 2026-06-26 缓存

使用Artificial Analysis Intelligence Index和其他基准测试分析开源权重与闭源大语言模型之间的差距,发现在某些指标上差距正在缩小,但在其他指标上保持稳定。

0 人收藏 0 人点赞
#artificial-analysis

GLM-5.2 是 Artificial Analysis 上新的领先开源权重模型

Hacker News Top · 2026-06-17 缓存

智谱AI的GLM-5.2已成为Artificial Analysis Intelligence Index上新的领先开源权重模型,得分为51,超越了MiniMax-M3和DeepSeek V4 Pro等竞争对手。该模型拥有744B总参数、40B活跃参数、MIT许可证和1M上下文窗口。

0 人收藏 0 人点赞
#artificial-analysis

GLM-5.2 (max) 目前是开源和专有模型中第三好的模型。

Reddit r/LocalLLaMA · 2026-06-17 缓存

根据 Artificial Analysis 的 Intelligence Index,GLM-5.2 (max) 目前整体上排名第三,包含对智能性、开放性、成本和令牌使用量的详细分析。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈