标签
来自Google和OpenAI的闭源模型已占据OpenRouter的第二和第三位,该平台传统上更青睐较便宜的中国开放权重模型
Qwen3.8-27B迅速成为通义千问HuggingFace页面上最受欢迎的模型,超越了QwQ-32B,用户更倾向于参数规模在27B和9B左右的模型。
Qwen3.8 Max 目前在 Artificial Analysis 的智能体指数中排名第一,在独立评估中超越了其他领先的AI模型。
本文将多模型人类评估形式化为多臂老虎机设置中的最佳臂识别问题,自适应地分配标注努力以聚焦于有竞争力的模型,并提高排名区分度。
DeepSeek V4 flash 0731 在 Agent Arena 中排名第21位,低于 Sonnet 4.6 和 Luna,但用户欣赏其开源性,以获得隐私和控制。
一条推文,按从最小到最大的顺序排列最佳开放权重AI模型,突出开放权重社区的活力。
Kimi K3 模型在 ArtificialAnalysis 基准测试中排名第三,超过了 Claude Opus 4.8。
Arena.ai 将事实性(Factuality)加入模型排名,支持人类偏好与事实性加权,并展示了各模型排名变化。
本文介绍了一种基于频谱形状的度量,利用重尾自正则化理论来表征、比较和管理大型语言模型。该方法无需数据、计算高效且尺度不变,支持跨多种模型集合的血统追踪、无监督聚类和性能量化。
作者介绍了 LLM Win,这是一个将大语言模型(LLM)基准测试结果可视化为有向图的工具,用于分析传递关系和排名逆转。实验结果表明,LLM 的排名更像是一个具有较高弱到强可达性的能力图,而非线性阶梯。