llm-benchmarks

标签

Cards List
#llm-benchmarks

是我的错觉,还是当前的LLM基准测试未能捕捉到实际可用性?(Gemma 4 对比 Gemini/Claude Opus)

Reddit r/LocalLLaMA · 23小时前

作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。

0 人收藏 0 人点赞
#llm-benchmarks

量化LLM基准中的排名不确定性

arXiv cs.LG · 2026-07-21 缓存

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

0 人收藏 0 人点赞
#llm-benchmarks

我在8GB显存下在Terminal-Bench 2.0上运行了Ternary-Bonsai-27B(2-bit)和Bonsai-27B(1-bit)

Reddit r/LocalLLaMA · 2026-07-20

一位用户在Terminal-Bench 2.0上测试了27B参数Bonsai模型的量化1-bit和2-bit版本,在8GB显存内获得了结果。

0 人收藏 0 人点赞
#llm-benchmarks

核心集先行于分数集:面向LLM基准的评估无监督提示子集选择

arXiv cs.AI · 2026-07-14 缓存

本文提出了一种面向LLM基准的子模核心集选择方法,该方法在不使用模型评估结果的情况下选择提示子集,在35个基准和18个LLM上实现了分数保持。

0 人收藏 0 人点赞
#llm-benchmarks

LM Arena 已经过时了吗?

Reddit r/LocalLLaMA · 2026-07-10

一位用户批评 LM Arena 没有收录最近的开源模型(如 Qwen3.6 和 Step 3.7 Flash),质疑该平台在比较新开源模型与闭源模型方面的相关性。

0 人收藏 0 人点赞
#llm-benchmarks

每个AI可见性工具都在欺骗你

Hacker News Top · 2026-07-03 缓存

本文批判性地审视了声称能衡量品牌在生成式AI回复中曝光度的AI可见性工具,指出由于非确定性、个性化和抓取偏差,这些工具提供了虚假精度。文章呼吁方法透明,并警告不要将不透明的仪表盘视为稳定真相。

0 人收藏 0 人点赞
#llm-benchmarks

开源权重大语言模型与闭源大语言模型之间的差距

Hacker News Top · 2026-06-26 缓存

使用Artificial Analysis Intelligence Index和其他基准测试分析开源权重与闭源大语言模型之间的差距,发现在某些指标上差距正在缩小,但在其他指标上保持稳定。

0 人收藏 0 人点赞
#llm-benchmarks

@ms_aifrontiers: 大多数LLM基准测试得分在运行之前即可预测。MS AI Frontiers团队新作:BenchPress。……

X AI KOLs Following · 2026-06-25 缓存

MS AI Frontiers团队推出了BenchPress,该方法利用矩阵补全技术,仅通过五个探针即可预测LLM基准测试得分,表明得分矩阵实际上为秩2。

0 人收藏 0 人点赞
#llm-benchmarks

最新eBay特价品基准测试:W6800(改装版V620)

Reddit r/LocalLLaMA · 2026-06-17

一位用户对一款刷入W6800固件并配备定制吹风风扇的改装版AMD V620 GPU进行了基准测试,通过Vulkan和ROCm后端运行大型语言模型,比较了Qwen2.5-27B在不同量化级别下的性能表现。

0 人收藏 0 人点赞
#llm-benchmarks

# 这些大语言模型在抵御俄罗斯宣传方面表现最佳

Ars Technica · 2026-06-04 缓存

爱沙尼亚语言研究所开展的一项基准测试评估了各大LLM抵御俄罗斯宣传内容的能力,结果显示Nvidia的Nemotron、阿里巴巴的Qwen以及OpenAI的GPT-4.5表现优异,而Google的Gemini系列模型则表现出明显的薄弱之处,尤其是在以俄语提问时。

0 人收藏 0 人点赞
#llm-benchmarks

使用项目反应理论审计LLM基准测试

arXiv cs.CL · 2026-06-01 缓存

本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。

0 人收藏 0 人点赞
#llm-benchmarks

识别并缓解生产级LLM推理基准中的系统性测量偏差

arXiv cs.AI · 2026-05-26 缓存

本文识别了由使用asyncio的单进程Python客户端导致的生产级LLM推理基准中的系统性测量偏差,并提出了一种多进程评估框架和一个新指标(NTPOT),以便在规模上准确分析服务引擎的性能。

0 人收藏 0 人点赞
#llm-benchmarks

EnvSimBench:用于评估和改善基于大语言模型的环境模拟的基准

arXiv cs.AI · 2026-05-11 缓存

本文介绍了 EnvSimBench,这是一个用于评估大语言模型在智能体训练中模拟环境能力的基准。它指出了当前大语言模型中存在的“状态变化悬崖”问题,并提出了一种约束驱动的流水线以减少幻觉和降低成本。

0 人收藏 0 人点赞
#llm-benchmarks

@omarsar0: 苹果的一篇很棒的论文。大多数对工具调用智能体的评估都发生在轨迹结束之后。但那时错误的调用早已发出。这篇新论文将评估移入执行循环中。一个专门的审稿智能体在执行前检查每个临时工具调用。如果有问题,它注入反馈,主智能体进行修正。为了量化修正与新错误之间的权衡,他们提出了“有益性-有害性”指标。有益性衡量基础错误被修复的百分比;有害性衡量因审稿而降低正确调用质量的比例。在 BFCL 上的结果:无关检测准确率提升 5.5%(从 84.9% 到 90.4%),相关检测提升 1.6%,且无需重新训练基础智能体。在 τ²-Bench 多轮任务上提升 7.1%(从 48.7% 到 55.8%)。推理模型审稿者比 GPT-4o 获得 3:1 的收益风险比,而 GPT-4o 为 2.1:1。加入 GEPA 提示优化可再提升 1.5–2.8%。为什么这很重要?你可以保持基础工具调用智能体不变,仅通过改进审稿者即可实现显著的准确性提升。对审稿者的模型选择和提示优化成为独立的生产杠杆。论文链接:https://arxiv.org/abs/2604.27233 在我们的学院学习如何构建高效的 AI 智能体:https://academy.dair.ai

X AI KOLs Timeline · 2026-05-10 缓存

这篇来自苹果的研究论文介绍了“强化智能体”(Reinforced Agent)方法,通过使用专门的审稿智能体在实时执行过程中修正工具调用错误,将评估纳入执行循环。它在 BFCL 和 τ²-Bench 等基准测试上展示了显著的准确性提升,而无需重新训练基础智能体。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈