标签
用户希望获得Mac M5 Ultra 256GB的严肃性能测试数据,用于对比Nvidia GPU的工作表现,并批评现有网红主导的内容缺乏深度。
本文引入了一种双模型掩码度量,对序列推荐系统中时间归因的十种可解释方法进行基准测试,发现基于梯度的方法如GradientSHAP和Integrated Gradients产生最忠实和稳健的归因。
本文探讨了基于LLM评分的基准测试的测量限制,指出其泛化能力受到评判者差异的影响,且协议设计对性能上限有显著影响,从而对AI基准测试方法具有借鉴意义。
本文在ContractNLI上比较了JEV与九种语言模型,评估了不同请求配置下的推理成本、响应时间和正确性,发现JEV具有更低的成本和响应时间,而语言模型达到了更高的基线准确率。
本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。
本研究探讨大语言模型是否内部按主题或方法组织数学推理,发现方法是关键组织原则的证据,挑战了传统的基准测试方法。
CoMed 引入了一个后锚点控制器,用于多LLM系统中的选择性跨模型协作,提高了在 MedQA 和 HLE 等基准测试上的准确性,同时与密集协作相比降低了计算成本。
Virtio-nvgpu实现了在KVM虚拟机内部接近原生的NVIDIA GPU访问,在帧渲染方面实现了与裸机相比仅2%以内的性能差距,并支持多个虚拟机之间的高效GPU共享。
Mercury 2.5 LLM 在通过各种智能基准测试和能力指数评估后,达到了每秒 770 tokens 的速度。
本文批评了 Jev,认为它并非新的 AI 范式,而是一种专门的分类器,其营销针对那些将 AI 等同于 LLMs 的人群。
Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。
这篇文章突出了一项性能基准测试,其中将代码从 Swift 重写为 Objective-C 大幅提升了执行时间,对于大型数据集,从毫秒级缩短到微秒级。
本文介绍了一个用于评估LLM智能体作为现场部署工程师在训练后交付中的基准测试,重点指出了关键的'训练但不学习'失败模式,即模型优化但并未真正学习。
FireWorldBench是一个基准,通过耦合场火灾动力学评估多模态大语言模型中的复杂物理世界智能,专注于预测、感知和因果推理等任务。
本文引入'stale'基准,以研究并行LLM-Agent开发中的语义协调失败,表明在受控任务中干扰频繁,但在实际审查的拉取请求中罕见。
本文介绍了一种验证感知的弱监督框架,用于在去中心化社交媒体平台Bluesky上构建和评估自杀意念和心理健康披露基准,利用像Llama-3-8B和基于transformer的分类器等AI模型来分析性能和标签有效性。
FinFIRST 引入了一个基准,通过原子化标准共同评估答案和支持证据,用于评价金融搜索代理,包含 123 个由专家撰写的任务,涵盖不同难度级别。
本文系统地评估了多模态文档问答的输入表示(图像、文本或两者),发现图像可以提高准确性但增加延迟,并提出了一种TF-IDF路由机制来优化性能。
本文介绍了在QMSum数据集上用于高效查询聚焦会议摘要的检索片段训练,表明在检索片段上进行微调可以恢复性能损失,并且较小的406M模型使用自动指标可以达到与较大模型相当的结果。
KVMEM通过保留旧的KV缓存状态来增强AI代理内存,在长期运行的代理中,与压缩方法相比,提高了任务性能和效率。