benchmarking

标签

Cards List
#benchmarking

大家入手了256GB的Mac M5 Ultra没?我们需要硬核跑分,YouTube那些网红UP主的数据不靠谱

Reddit r/LocalLLaMA · 5小时前

用户希望获得Mac M5 Ultra 256GB的严肃性能测试数据,用于对比Nvidia GPU的工作表现,并批评现有网红主导的内容缺乏深度。

0 人收藏 0 人点赞
#benchmarking

序列推荐系统中时间归因可解释方法的系统基准测试

arXiv cs.LG · 9小时前 缓存

本文引入了一种双模型掩码度量,对序列推荐系统中时间归因的十种可解释方法进行基准测试,发现基于梯度的方法如GradientSHAP和Integrated Gradients产生最忠实和稳健的归因。

0 人收藏 0 人点赞
#benchmarking

选择而非评判:由LLM评分的评估基准

arXiv cs.AI · 9小时前 缓存

本文探讨了基于LLM评分的基准测试的测量限制,指出其泛化能力受到评判者差异的影响,且协议设计对性能上限有显著影响,从而对AI基准测试方法具有借鉴意义。

0 人收藏 0 人点赞
#benchmarking

相同分数,不同决策:评估JEV和语言模型在法律文档理解中的应用

arXiv cs.CL · 9小时前 缓存

本文在ContractNLI上比较了JEV与九种语言模型,评估了不同请求配置下的推理成本、响应时间和正确性,发现JEV具有更低的成本和响应时间,而语言模型达到了更高的基线准确率。

0 人收藏 0 人点赞
#benchmarking

把握关键:大规模推理的原理化上下文表示

arXiv cs.CL · 9小时前 缓存

本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。

0 人收藏 0 人点赞
#benchmarking

LLMs中的数学推理按方法组织,而非主题

arXiv cs.AI · 9小时前 缓存

本研究探讨大语言模型是否内部按主题或方法组织数学推理,发现方法是关键组织原则的证据,挑战了传统的基准测试方法。

0 人收藏 0 人点赞
#benchmarking

COMED:多LLM推理中路由与协作之间的缺失环节

arXiv cs.CL · 9小时前 缓存

CoMed 引入了一个后锚点控制器,用于多LLM系统中的选择性跨模型协作,提高了在 MedQA 和 HLE 等基准测试上的准确性,同时与密集协作相比降低了计算成本。

0 人收藏 0 人点赞
#benchmarking

Virtio-nvgpu:在KVM虚拟机内部实现接近原生的NVIDIA GPU访问

Hacker News Top · 12小时前 缓存

Virtio-nvgpu实现了在KVM虚拟机内部接近原生的NVIDIA GPU访问,在帧渲染方面实现了与裸机相比仅2%以内的性能差距,并支持多个虚拟机之间的高效GPU共享。

0 人收藏 0 人点赞
#benchmarking

Mercury 2.5 LLM 达到每秒 770 tokens 的速度

Hacker News Top · 15小时前 缓存

Mercury 2.5 LLM 在通过各种智能基准测试和能力指数评估后,达到了每秒 770 tokens 的速度。

0 人收藏 0 人点赞
#benchmarking

Jev 并非新技术。其营销对象是那些认为 AI 起始于 LLMs 的人。

Reddit r/LocalLLaMA · 19小时前

本文批评了 Jev,认为它并非新的 AI 范式,而是一种专门的分类器,其营销针对那些将 AI 等同于 LLMs 的人群。

0 人收藏 0 人点赞
#benchmarking

我将 Qwen3.8-27B Q2_64 + llama.cpp 转换为一个完全 TypeSafe AI 兼容的 Jev 风格系统。OpenAI API 仍然完整!全球首个支持视觉的 Jev 风格模型!显存占用低于 10 GB,在 RTX 3090 上延迟 170 毫秒,聊天速度约 140 tok/s。在包含 22,000 个请求的多样化类型决策基准测试中,准确率为 76%,而 Jev-1.13 为 88%。

Reddit r/LocalLLaMA · 23小时前

Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。

0 人收藏 0 人点赞
#benchmarking

@krzyzanowskim: Swift 很快,但当我将类重写为 Objective-C 后,变化为:在 1M 单位时,21.3 ms → 95 µs;在 67K 时,384 µs → 6.4 µs。

X AI KOLs Following · 昨天 缓存

这篇文章突出了一项性能基准测试,其中将代码从 Swift 重写为 Objective-C 大幅提升了执行时间,对于大型数据集,从毫秒级缩短到微秒级。

0 人收藏 0 人点赞
#benchmarking

训练而不学习:针对LLM智能体作为现场部署工程师的训练后交付基准测试

arXiv cs.LG · 昨天 缓存

本文介绍了一个用于评估LLM智能体作为现场部署工程师在训练后交付中的基准测试,重点指出了关键的'训练但不学习'失败模式,即模型优化但并未真正学习。

0 人收藏 0 人点赞
#benchmarking

FireWorldBench:通过耦合场火灾动力学评估复杂物理世界智能

arXiv cs.AI · 昨天 缓存

FireWorldBench是一个基准,通过耦合场火灾动力学评估多模态大语言模型中的复杂物理世界智能,专注于预测、感知和因果推理等任务。

0 人收藏 0 人点赞
#benchmarking

独自通过,协作失败:并行LLM-Agent开发中的语义协调基准测试

arXiv cs.CL · 昨天 缓存

本文引入'stale'基准,以研究并行LLM-Agent开发中的语义协调失败,表明在受控任务中干扰频繁,但在实际审查的拉取请求中罕见。

0 人收藏 0 人点赞
#benchmarking

在Bluesky上构建可信的心理健康基准:一种验证感知的弱监督框架

arXiv cs.AI · 昨天 缓存

本文介绍了一种验证感知的弱监督框架,用于在去中心化社交媒体平台Bluesky上构建和评估自杀意念和心理健康披露基准,利用像Llama-3-8B和基于transformer的分类器等AI模型来分析性能和标签有效性。

0 人收藏 0 人点赞
#benchmarking

FinFIRST: 金融信息检索、来源与可追溯性搜索代理基准测试

arXiv cs.CL · 昨天 缓存

FinFIRST 引入了一个基准,通过原子化标准共同评估答案和支持证据,用于评价金融搜索代理,包含 123 个由专家撰写的任务,涵盖不同难度级别。

0 人收藏 0 人点赞
#benchmarking

文本、像素,还是两者兼有?评估多模态文档问答的输入表示

arXiv cs.AI · 昨天 缓存

本文系统地评估了多模态文档问答的输入表示(图像、文本或两者),发现图像可以提高准确性但增加延迟,并提出了一种TF-IDF路由机制来优化性能。

0 人收藏 0 人点赞
#benchmarking

基于QMSum的高效查询聚焦会议摘要检索片段训练

arXiv cs.CL · 昨天 缓存

本文介绍了在QMSum数据集上用于高效查询聚焦会议摘要的检索片段训练,表明在检索片段上进行微调可以恢复性能损失,并且较小的406M模型使用自动指标可以达到与较大模型相当的结果。

0 人收藏 0 人点赞
#benchmarking

@rohanpaul_ai:模型的上下文窗口不必是代理的工作空间限制。KVMEM使百万级令牌代理内存成为现实……

X AI KOLs Following · 昨天 缓存

KVMEM通过保留旧的KV缓存状态来增强AI代理内存,在长期运行的代理中,与压缩方法相比,提高了任务性能和效率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈