model-ranking

标签

Cards List
#model-ranking

Google与OpenAI的闭源模型目前在OpenRouter上占据第二和第三位,而该平台传统上偏向于更便宜的中国开放权重模型

Reddit r/ArtificialInteligence · 4天前

来自Google和OpenAI的闭源模型已占据OpenRouter的第二和第三位,该平台传统上更青睐较便宜的中国开放权重模型

0 人收藏 0 人点赞
#model-ranking

通义千问HuggingFace页面上最受欢迎的十大模型

Reddit r/LocalLLaMA · 2026-08-24

Qwen3.8-27B迅速成为通义千问HuggingFace页面上最受欢迎的模型,超越了QwQ-32B,用户更倾向于参数规模在27B和9B左右的模型。

0 人收藏 0 人点赞
#model-ranking

Qwen3.8 Max 在智能体指数中被评为最佳整体模型

Hacker News Top · 2026-08-06 缓存

Qwen3.8 Max 目前在 Artificial Analysis 的智能体指数中排名第一,在独立评估中超越了其他领先的AI模型。

0 人收藏 0 人点赞
#model-ranking

动态分配评估努力以进行模型排名

arXiv cs.CL · 2026-08-05 缓存

本文将多模型人类评估形式化为多臂老虎机设置中的最佳臂识别问题,自适应地分配标注努力以聚焦于有竞争力的模型,并提高排名区分度。

0 人收藏 0 人点赞
#model-ranking

DeepSeek V4 flash 0731 在 Agent Arena 排名第21位

Reddit r/LocalLLaMA · 2026-08-04

DeepSeek V4 flash 0731 在 Agent Arena 中排名第21位,低于 Sonnet 4.6 和 Luna,但用户欣赏其开源性,以获得隐私和控制。

0 人收藏 0 人点赞
#model-ranking

@0xSero:目前从最小到最大的最佳模型。- Gemma-4-12B - Qwen3.8-27B - Laguna-S2.1 - Deepseek-V4-Flash - Inkling-Smal…

X AI KOLs Timeline · 2026-08-03 缓存

一条推文,按从最小到最大的顺序排列最佳开放权重AI模型,突出开放权重社区的活力。

0 人收藏 0 人点赞
#model-ranking

Kimi K3 在 ArtificialAnalysis 上获得第三名,击败了 Claude Opus 4.8

Reddit r/singularity · 2026-07-16

Kimi K3 模型在 ArtificialAnalysis 基准测试中排名第三,超过了 Claude Opus 4.8。

0 人收藏 0 人点赞
#model-ranking

@mylifcc: http://Arena.ai 刚刚把「事实性(Factuality)」正式加入模型排名。 现在排行榜支持「人类偏好 + 事实性」加权查看(默认 25% 事实性权重)。他们已标注超过 200 万个真实对话中的 claims(Text Ar…

X AI KOLs Timeline · 2026-07-15 缓存

Arena.ai 将事实性(Factuality)加入模型排名,支持人类偏好与事实性加权,并展示了各模型排名变化。

0 人收藏 0 人点赞
#model-ranking

大型语言模型的频谱特征

arXiv cs.CL · 2026-07-07 缓存

本文介绍了一种基于频谱形状的度量,利用重尾自正则化理论来表征、比较和管理大型语言模型。该方法无需数据、计算高效且尺度不变,支持跨多种模型集合的血统追踪、无监督聚类和性能量化。

0 人收藏 0 人点赞
#model-ranking

LLM 排名并非阶梯:来自传递性基准图的实验结果 [D]

Reddit r/MachineLearning · 2026-05-09

作者介绍了 LLM Win,这是一个将大语言模型(LLM)基准测试结果可视化为有向图的工具,用于分析传递关系和排名逆转。实验结果表明,LLM 的排名更像是一个具有较高弱到强可达性的能力图,而非线性阶梯。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈