benchmark

标签

Cards List
#benchmark

为消费级Nvidia显卡启用PCI-E P2P将带来超乎你想象的收益

Reddit r/LocalLLaMA · 2小时前

通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。

0 人收藏 0 人点赞
#benchmark

@jakevin7: https://x.com/jakevin7/status/2086031167040426488

X AI KOLs Timeline · 14小时前 缓存

Maka 是一个开源 Agent Harness,通过日志即运行时、上下文剪枝、thinking 回传等机制,将同一 DeepSeek 任务的成本降至 OpenCode 的 1/8,并在 Terminal-Bench 上以更低成本取得更高通过率。

0 人收藏 0 人点赞
#benchmark

@rohanpaul_ai: Grok Imagine Image 2.0(低)来自@SpaceXAI 上升12位至第2名,超越了自己旧版的质量模型。之前的…

X AI KOLs Following · 18小时前 缓存

xAI的Grok Imagine Image 2.0(低)在文生图竞技场跃升至第2名,超越了自己旧版的质量模型,显示出显著进步。

0 人收藏 0 人点赞
#benchmark

Qwen 35B-A3B MoE 与 27B dense 本地编码测试对比:速度快约 4 倍,质量差距远小于预期

Reddit r/LocalLLaMA · 18小时前

一项本地实验,在代码维护任务上比较 Qwen 35B-A3B MoE 和 Qwen 27B dense,发现 MoE 模型速度快约 3.9 倍,且质量差距比预期更小。

0 人收藏 0 人点赞
#benchmark

@rohanpaul_ai: Meta的Muse Spark 1.2升至第4位,同时将Text Arena的成本-质量帕累托前沿向上推进。你只损失9分……

X AI KOLs Following · 19小时前 缓存

Meta的Muse Spark 1.2在Text Arena中升至第4位,通过降价约91%将成本-质量帕累托前沿向上推进,同时相比顶级模型仅损失9分。

0 人收藏 0 人点赞
#benchmark

@TheAhmadOsman:在 DGX Station 上运行 DeepSeek V4 Flash 0731 的一些数据

X AI KOLs Timeline · 20小时前 缓存

Ahmad Osman 分享了在 NVIDIA DGX Station 上运行 DeepSeek V4 Flash 0731 的性能数据。

0 人收藏 0 人点赞
#benchmark

@DeFiMinty: AI系统能否持续为AI智能体生成更难的训练任务?腾讯的新研究表明可以。递归…

X AI KOLs Following · 20小时前 缓存

腾讯的一项新研究引入了递归合成终端任务(RST),这是一种逐步为AI智能体生成更难、可验证的训练任务的方法。从639个任务开始,它在15轮中生成了37,484个经过验证的任务,使用这些任务进行强化学习将Qwen3.5-27B在Terminal-Bench Hard上的性能从22.7%提升到32.0%。

0 人收藏 0 人点赞
#benchmark

@samsja19:很棒的基准

X AI KOLs Following · 21小时前 缓存

介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。

0 人收藏 0 人点赞
#benchmark

DeepSeek V4 Flash 0731

Hacker News Top · 昨天 缓存

DeepSeek V4 Flash 0731 展示了其在 ARC-AGI 基准上的结果,突显了 AI 模型在抽象推理方面的进展。

0 人收藏 0 人点赞
#benchmark

TutorMoments:AI导师知道何时该帮助、何时该收手吗?

Hugging Face Blog · 昨天 缓存

Ai2推出了TutorMoments,一个基于回放的评估框架和数据集,用于衡量大语言模型在1对1数学辅导中能否平衡何时提供帮助与何时放手。初步结果显示,模型倾向于过度帮助,而提示工程只能部分缩小与人类导师的差距。

0 人收藏 0 人点赞
#benchmark

测试XPS 13后,我对Intel充满期待

Jeff Geerling · 昨天 缓存

Jeff Geerling评测了搭载Intel Core 5 320的Dell XPS 13,着重介绍其出色的能效和Linux兼容性,并对Intel的低端处理器方向表示乐观。

0 人收藏 0 人点赞
#benchmark

@joelniklaus: Codex 对大型模型过度优化:在 GLM 5.2 的 10 个框架中排名第 2,但在 Gemma-4 上跌至第 9!几乎……

X AI KOLs Timeline · 昨天 缓存

一项在 SWE-bench Pro 上比较 10 种编码智能体框架(harness)的研究表明,框架选择会显著影响 pass@1 和成本,并揭示厂商提供的框架对大型模型过拟合,无法迁移到较小的模型。

0 人收藏 0 人点赞
#benchmark

@VraserX: Seedance 2.5 终于来了。我使用完全相同的提示词,将它与 Seedance 2.0 进行正面比较,涵盖四种完全不同的电影类…

X AI KOLs Following · 昨天 缓存

用户分享了 Seedance 2.5 与 Seedance 2.0 在四种电影类型上的正面比较,指出输出质量存在显著差异。

0 人收藏 0 人点赞
#benchmark

LabyrinthBench:一个本地优先、无需裁判的LLM基准测试,用于衡量多步骤智能体任务中干扰下的上下文记忆。

Reddit r/LocalLLaMA · 昨天

LabyrinthBench是一个本地化、无需裁判的LLM基准测试,能够确定性地衡量多步骤智能体任务中干扰下的上下文记忆。初步实验表明,清空上下文并重新注入门控答案对9个模型中的7个有帮助,但对2个适得其反,凸显了上下文管理策略的复杂性。

0 人收藏 0 人点赞
#benchmark

@reach_vb: luna-maxxing,成本降低80%!

X AI KOLs Timeline · 昨天 缓存

ARC Prize在价格下调80%后重新测试了OpenAI的GPT-5.6 Luna在ARC-AGI上的表现,确认其在每项任务成本大幅降低的情况下性能相似。

0 人收藏 0 人点赞
#benchmark

不确定性的一致风险视角:用于解耦和超越代理评估的后验风险

arXiv cs.LG · 昨天 缓存

本文提出了一种将不确定性统一定义为逐点后验风险的方法,并引入了一个有理论支持的基准,利用半合成数据集直接计算神谕认知不确定性和偶然不确定性,从而超越代理任务实现细粒度评估。

0 人收藏 0 人点赞
#benchmark

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

arXiv cs.CL · 昨天 缓存

Presents FormBharo, a voice agent that uses LLMs with rule-based controls to fill structured forms over phone calls for low-literacy Hindi-speaking users in India, piloted with ARMMAN. The paper also introduces FormVoiceAgentBench, a benchmark of 3,760 multi-turn conversation tests, and shows that end-to-end evaluation is necessary since component-level performance does not predict full form completion.

0 人收藏 0 人点赞
#benchmark

EpiBench:LLMs 能否理解抗体药物发现中的表位?

arXiv cs.CL · 昨天 缓存

EpiBench 是一个新的闭卷、基于序列的基准,用于评估 LLMs 在五项抗体药物发现任务中对表位的理解程度,结果发现当前模型能捕获部分信号,但在抗体特异性推理方面存在困难。

0 人收藏 0 人点赞
#benchmark

MameLoshnLM:意第绪语语言模型与评估基准

arXiv cs.CL · 昨天 缓存

本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。

0 人收藏 0 人点赞
#benchmark

MoCA:隐式社会情境分析

arXiv cs.CL · 昨天 缓存

介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈