llm-benchmarks

标签

Cards List
#llm-benchmarks

@theo:新一轮评测刚结束。GPT-6.1 Sol 依然遥遥领先。结果发现它在 Codex 中的表现比在 mini-swe(也就是…

X AI KOLs Timeline ↗ · 23小时前 缓存

Theo(t3.gg)报告称,GPT-6.1 Sol 在 Codex 中的表现明显优于 Artificial Analysis 采用的 mini-swe 基准,在 Terminal Bench 4 上的得分超过了 Opus 5.5,而价格只有其约 1/30。

0 人收藏 0 人点赞
#llm-benchmarks

通过专家指导生成有效上下文特定基准的框架

arXiv cs.AI ↗ · 2026-09-16 缓存

本文提出了一种利用专家指导和合成数据生成上下文特定大语言模型基准数据集的框架,提高了有效性和可扩展性,优于现有方法。

0 人收藏 0 人点赞
#llm-benchmarks

仅凭表面判断:清理LLM真实性基准以避免表面特征泄露

arXiv cs.CL ↗ · 2026-09-14 缓存

本文识别了如TruthfulQA等真实性基准中的表面特征泄露问题,在此问题中,模型可以通过利用答案形式差异来作弊,并介绍了Audit-Prune来清理基准,确保更可靠的评估。

0 人收藏 0 人点赞
#llm-benchmarks

BenchMIRT:LLM 基准测试实际在测量什么?

Hugging Face Blog ↗ · 2026-09-01 缓存

BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。

0 人收藏 0 人点赞
#llm-benchmarks

所有当前流行本地模型一览表 + Opus 4.8 测试结果

Reddit r/LocalLLaMA ↗ · 2026-09-01

本文提供了一份流行本地AI模型的对比表格,涵盖代理、编码、通用和多模态任务等各种基准测试,以帮助用户根据硬件规格和用例选择模型。

0 人收藏 0 人点赞
#llm-benchmarks

Qwen-3.8-27B、Nemotron-3.5-Lightning-30B-A3B、Ornith-1.5-35B-A3B、Muse-Glimmer-30B oQ8e 对比

Reddit r/LocalLLaMA ↗ · 2026-08-24

对比了多个AI模型,包括Qwen、Nemotron、Ornith和Muse-Glimmer在基准测试上的表现。Ornith表现优异,而TielCoder在编程任务中展现了潜力。

0 人收藏 0 人点赞
#llm-benchmarks

为什么你的本地LLM感觉比实际更笨?

Hacker News Top ↗ · 2026-08-22 缓存

文章探讨了为什么本地运行的LLM可能显得不那么智能,并涉及潜在的性能或感知问题。

0 人收藏 0 人点赞
#llm-benchmarks

智能成本下降100倍时会发生什么?

Hacker News Top ↗ · 2026-08-21 缓存

这篇文章分析了AI智能成本的快速下降,六个月内降低了56倍,并探讨了其对扩展AI应用和未来趋势的影响。

0 人收藏 0 人点赞
#llm-benchmarks

Qwen 3.8 - 27B 是颠覆性的

Reddit r/LocalLLaMA ↗ · 2026-08-15

文章重点介绍了 Qwen 3.8 27B 模型在网络安全任务中的卓越表现,特别是恶意软件分析,超越了之前的模型如 Opus。它讨论了基准测试和 AI 在漏洞利用能力方面的影响。

0 人收藏 0 人点赞
#llm-benchmarks

The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

arXiv cs.CL ↗ · 2026-08-13 缓存

This paper introduces BenchDrift, a method for quantifying how LLM benchmark performance changes when problems are rephrased without changing meaning or answer. It shows that rephrasing causes bidirectional correctness flips across models and benchmarks, with stronger models becoming more sensitive to phrasing.

0 人收藏 0 人点赞
#llm-benchmarks

当AI基准陷入平台期:基准饱和的系统性研究

Hacker News Top ↗ · 2026-08-04 缓存

一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。

0 人收藏 0 人点赞
#llm-benchmarks

是我的错觉,还是当前的LLM基准测试未能捕捉到实际可用性?(Gemma 4 对比 Gemini/Claude Opus)

Reddit r/LocalLLaMA ↗ · 2026-07-31

作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。

0 人收藏 0 人点赞
#llm-benchmarks

量化LLM基准中的排名不确定性

arXiv cs.LG ↗ · 2026-07-21 缓存

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

0 人收藏 0 人点赞
#llm-benchmarks

我在8GB显存下在Terminal-Bench 2.0上运行了Ternary-Bonsai-27B(2-bit)和Bonsai-27B(1-bit)

Reddit r/LocalLLaMA ↗ · 2026-07-20

一位用户在Terminal-Bench 2.0上测试了27B参数Bonsai模型的量化1-bit和2-bit版本,在8GB显存内获得了结果。

0 人收藏 0 人点赞
#llm-benchmarks

核心集先行于分数集:面向LLM基准的评估无监督提示子集选择

arXiv cs.AI ↗ · 2026-07-14 缓存

本文提出了一种面向LLM基准的子模核心集选择方法,该方法在不使用模型评估结果的情况下选择提示子集,在35个基准和18个LLM上实现了分数保持。

0 人收藏 0 人点赞
#llm-benchmarks

LM Arena 已经过时了吗?

Reddit r/LocalLLaMA ↗ · 2026-07-10

一位用户批评 LM Arena 没有收录最近的开源模型(如 Qwen3.6 和 Step 3.7 Flash),质疑该平台在比较新开源模型与闭源模型方面的相关性。

0 人收藏 0 人点赞
#llm-benchmarks

每个AI可见性工具都在欺骗你

Hacker News Top ↗ · 2026-07-03 缓存

本文批判性地审视了声称能衡量品牌在生成式AI回复中曝光度的AI可见性工具,指出由于非确定性、个性化和抓取偏差,这些工具提供了虚假精度。文章呼吁方法透明,并警告不要将不透明的仪表盘视为稳定真相。

0 人收藏 0 人点赞
#llm-benchmarks

开源权重大语言模型与闭源大语言模型之间的差距

Hacker News Top ↗ · 2026-06-26 缓存

使用Artificial Analysis Intelligence Index和其他基准测试分析开源权重与闭源大语言模型之间的差距,发现在某些指标上差距正在缩小,但在其他指标上保持稳定。

0 人收藏 0 人点赞
#llm-benchmarks

@ms_aifrontiers: 大多数LLM基准测试得分在运行之前即可预测。MS AI Frontiers团队新作:BenchPress。……

X AI KOLs Following ↗ · 2026-06-25 缓存

MS AI Frontiers团队推出了BenchPress,该方法利用矩阵补全技术,仅通过五个探针即可预测LLM基准测试得分,表明得分矩阵实际上为秩2。

0 人收藏 0 人点赞
#llm-benchmarks

最新eBay特价品基准测试:W6800(改装版V620)

Reddit r/LocalLLaMA ↗ · 2026-06-17

一位用户对一款刷入W6800固件并配备定制吹风风扇的改装版AMD V620 GPU进行了基准测试,通过Vulkan和ROCm后端运行大型语言模型,比较了Qwen2.5-27B在不同量化级别下的性能表现。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈