标签
本文介绍了VQ-bench,一个用于组合和评测向量量化算法的统一框架,将25种常见量化器重新表示为原语流水线,并发布可复现的基准测试结果。
This paper introduces Cross-Contextual Consistency (C3), a behavioral property for measuring LLM credibility by checking whether answers remain stable under topic-aligned, content-neutral perturbations. Across 26 models and six benchmarks, they find that higher consistency correlates with correctness, offering a complementary evaluation axis.
对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。
作者对 DeepSeek V4 0731 进行量化,修复了会导致基线偏差的 FP8 降转换问题,并在 8× RTX 5090 上对 38 个量化文件进行基准测试,展示了依赖 GPU 的结果和基于文件大小的比较。
本文介绍了TSDS-Toolbox,一个用于测量时间序列数据集相似度的统一框架,支持相似度方法的系统比较、可扩展性以及一致的评估。
本文提出一种基于区块链的提交-揭示协议,以去中心化LLM基准测试中的信任,使用匿名多模型验证器来解决基准声明中的身份感知偏差和操纵问题。
推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。
一位用户分享了在 llama.cpp 上使用 OpenCode 对 Muse Glimmer(通过 Unsloth 的 Q4 量化)进行本地测试,指出其性能低于 Qwen3.6 27B,但工具调用可靠。
关于 Meta Muse Glimmer 的提醒:通过系统提示设置推理强度会被聊天模板的高默认值部分覆盖,而缺省默认值是高,不是关闭。使用 chat_template_kwargs.reasoning_strength 能提供更多控制。
Dan Luu 批评了关于动态语言对 LLM 更节省 token 的说法,指出现有评估中的缺陷,并强调需要更好的基准测试方法。
介绍了一种面向操作点的自适应数据清洗评估框架,用于纠正移除预算混淆。在 CIFAR-10 和 ImageNet-100 上的实验表明,当操作点匹配时,表面上的性能提升会消失,这表明许多改进反映的是更小的移除预算,而非真正的损坏判别能力。
Daniel Lemire 对 Go 中的性能剖析引导优化(PGO)进行了基准测试,显示在解析 JSON 时速度提升约为 2-5%,当训练 profile 与工作负载匹配时效果最佳。
介绍了 A2E,一个面向智能体框架(harness)的端到端评估引擎,利用标准化任务协议和执行轨迹来评估效率、工具使用、规划以及错误恢复等能力。
Matt Shumer 分享了一种将技能适配到 Claude Opus 5 的方法:一个循环,先更新技能,然后将更新后的技能与 Opus 4.8 上的旧技能进行基准对比,反复迭代直到 Opus 5 胜出。
OrchestraBench 是一个新的基准测试,用于评估多智能体编排框架在故障模式、恢复和分解质量方面的表现,通过故障注入和级联半径指标来诊断流水线在何处以及为何失败。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。
一位开发者对32个本地模型在智能体记忆的事实提取上进行了基准测试,表明F1分数掩盖了一个关键失败模式:分数相近的模型在“应输出空结果”的输入上编造事实的频率差异巨大。文章认为,智能体记忆评估必须包含空输出和撤回(retraction)案例。
一份关于衡量Transformer推理性能的实用教程,涵盖延迟、TTFT、吞吐量、内存使用等指标,以及针对LLM的基准测试技术。
本文探讨了 LuaJIT 的一个陷阱:诸如 unpack 之类的未实现(NYI)操作会悄然导致 trace 黑名单化,从而使基准测试性能降低 20 倍,并提供了在 CI 中防范此类问题的方法。
一项并排编码实验对比了GPT-5.6 Luna与DeepSeek V4 Flash,结果显示,在计入重试后,DeepSeek看似5倍的价格优势大幅缩水。文章主张采用更全面的基准测试,报告每次尝试的成本和每次验证成功的成本。