benchmarking

标签

Cards List
#benchmarking

VQ-bench:可组合的向量量化框架

arXiv cs.AI · 12小时前 缓存

本文介绍了VQ-bench,一个用于组合和评测向量量化算法的统一框架,将25种常见量化器重新表示为原语流水线,并发布可复现的基准测试结果。

0 人收藏 0 人点赞
#benchmarking

Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

arXiv cs.CL · 昨天 缓存

This paper introduces Cross-Contextual Consistency (C3), a behavioral property for measuring LLM credibility by checking whether answers remain stable under topic-aligned, content-neutral perturbations. Across 26 models and six benchmarks, they find that higher consistency correlates with correctness, offering a complementary evaluation axis.

0 人收藏 0 人点赞
#benchmarking

我实测了 CMP170HX

Reddit r/LocalLLaMA · 昨天

对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。

0 人收藏 0 人点赞
#benchmarking

我们对 DeepSeek V4 0731 进行了量化,并在 8× RTX 5090 上与其他流行的量化版本进行了基准测试

Reddit r/LocalLLaMA · 昨天

作者对 DeepSeek V4 0731 进行量化,修复了会导致基线偏差的 FP8 降转换问题,并在 8× RTX 5090 上对 38 个量化文件进行基准测试,展示了依赖 GPU 的结果和基于文件大小的比较。

0 人收藏 0 人点赞
#benchmarking

TSDS-Toolbox:用于测量时间序列数据集相似度的工具箱

arXiv cs.LG · 2天前 缓存

本文介绍了TSDS-Toolbox,一个用于测量时间序列数据集相似度的统一框架,支持相似度方法的系统比较、可扩展性以及一致的评估。

0 人收藏 0 人点赞
#benchmarking

谁来验证基准测试?去中心化大型语言模型评估中的信任

arXiv cs.AI · 2天前 缓存

本文提出一种基于区块链的提交-揭示协议,以去中心化LLM基准测试中的信任,使用匿名多模型验证器来解决基准声明中的身份感知偏差和操纵问题。

0 人收藏 0 人点赞
#benchmarking

Ling 3.0 Flash 在 Strix Halo 上的表现

Reddit r/LocalLLaMA · 2天前

推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。

0 人收藏 0 人点赞
#benchmarking

在本地使用 OpenCode 测试 Muse Glimmer 的编码与智能体工作

Reddit r/LocalLLaMA · 2天前

一位用户分享了在 llama.cpp 上使用 OpenCode 对 Muse Glimmer(通过 Unsloth 的 Q4 量化)进行本地测试,指出其性能低于 Qwen3.6 27B,但工具调用可靠。

0 人收藏 0 人点赞
#benchmarking

@no_stp_on_snek: Muse Glimmer 提醒——如果你正在测试 Meta 的 Muse Glimmer,在公开发布数据之前有两个服务配置陷阱值得了解…

X AI KOLs Timeline · 3天前 缓存

关于 Meta Muse Glimmer 的提醒:通过系统提示设置推理强度会被聊天模板的高默认值部分覆盖,而缺省默认值是高,不是关闭。使用 chat_template_kwargs.reasoning_strength 能提供更多控制。

0 人收藏 0 人点赞
#benchmarking

编程语言如何影响 token 效率和正确性?

Lobsters Hottest · 3天前 缓存

Dan Luu 批评了关于动态语言对 LLM 更节省 token 的说法,指出现有评估中的缺陷,并强调需要更好的基准测试方法。

0 人收藏 0 人点赞
#benchmarking

揭示移除预算混淆:自适应数据清洗的匹配操作点评估框架

arXiv cs.LG · 3天前 缓存

介绍了一种面向操作点的自适应数据清洗评估框架,用于纠正移除预算混淆。在 CIFAR-10 和 ImageNet-100 上的实验表明,当操作点匹配时,表面上的性能提升会消失,这表明许多改进反映的是更小的移除预算,而非真正的损坏判别能力。

0 人收藏 0 人点赞
#benchmarking

Go 中的性能剖析引导优化

Lobsters Hottest · 3天前 缓存

Daniel Lemire 对 Go 中的性能剖析引导优化(PGO)进行了基准测试,显示在解析 JSON 时速度提升约为 2-5%,当训练 profile 与工作负载匹配时效果最佳。

0 人收藏 0 人点赞
#benchmarking

A^2E:端到端智能体审计引擎

Hugging Face Daily Papers · 3天前 缓存

介绍了 A2E,一个面向智能体框架(harness)的端到端评估引擎,利用标准化任务协议和执行轨迹来评估效率、工具使用、规划以及错误恢复等能力。

0 人收藏 0 人点赞
#benchmarking

@mattshumer_:对于那些想在使用 Opus 5 时保留自己技能的人,这里有一个你可以尝试的技巧(告诉我进展如何):写……

X AI KOLs Timeline · 5天前 缓存

Matt Shumer 分享了一种将技能适配到 Claude Opus 5 的方法:一个循环,先更新技能,然后将更新后的技能与 Opus 4.8 上的旧技能进行基准对比,反复迭代直到 Opus 5 胜出。

0 人收藏 0 人点赞
#benchmarking

OrchestraBench:评估多智能体编排的故障模式、恢复与分解质量

arXiv cs.AI · 6天前 缓存

OrchestraBench 是一个新的基准测试,用于评估多智能体编排框架在故障模式、恢复和分解质量方面的表现,通过故障注入和级联半径指标来诊断流水线在何处以及为何失败。

0 人收藏 0 人点赞
#benchmarking

双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。

Reddit r/LocalLLaMA · 6天前

使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。

0 人收藏 0 人点赞
#benchmarking

我测试了32个模型的提取能力,结果令人惊讶

Reddit r/AI_Agents · 6天前

一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。

0 人收藏 0 人点赞
#benchmarking

@TeachTheMachine:衡量Transformer推理性能

X AI KOLs Timeline · 2026-08-06 缓存

一份关于衡量Transformer推理性能的实用教程,涵盖延迟、TTFT、吞吐量、内存使用等指标,以及针对LLM的基准测试技术。

0 人收藏 0 人点赞
#benchmarking

LuaJIT 中的一个 NYI 操作悄然毒害了无关的热循环

Lobsters Hottest · 2026-08-06 缓存

本文探讨了 LuaJIT 的一个陷阱:诸如 unpack 之类的未实现(NYI)操作会悄然导致 trace 黑名单化,从而使基准测试性能降低 20 倍,并提供了在 CI 中防范此类问题的方法。

0 人收藏 0 人点赞
#benchmarking

一旦计入重试次数,更便宜的AI模型未必更便宜

Reddit r/artificial · 2026-08-06

一项并排编码实验对比了GPT-5.6 Luna与DeepSeek V4 Flash,结果显示,在计入重试后,DeepSeek看似5倍的价格优势大幅缩水。文章主张采用更全面的基准测试,报告每次尝试的成本和每次验证成功的成本。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈