benchmarks

标签

Cards List
#benchmarks

英特尔最终能否在每瓦性能上击败ARM?

Hacker News Top · 昨天 缓存

Jeff Geerling的基准测试显示,戴尔XPS 13中的英特尔Core 5 320在每瓦性能上与苹果硅芯片持平或超越,这表明x86在能效上可以与ARM竞争。

0 人收藏 0 人点赞
#benchmarks

你的智能体上周二相信什么?

Reddit r/AI_Agents · 昨天

本文探讨了智能体记忆系统中有效时间和事务时间之间的区别,认为存储这两种时间戳对于重构智能体在特定时刻所知道的信息至关重要。文章还提议设计基准测试来检验智能体的时间推理能力。

0 人收藏 0 人点赞
#benchmarks

@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-Max,一个2.4万亿参数模型,每个token仅激活约950亿参数。一个……

X AI KOLs Timeline · 2天前 缓存

阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。

0 人收藏 0 人点赞
#benchmarks

还有人觉得 DeepSeek-V4-Flash 在非编程任务上不可靠吗?

Reddit r/LocalLLaMA · 2天前

一位用户报告称,尽管 DeepSeek-V4-Flash-0731 在基准测试中得分很高,但在摘要、会议记录等非编程办公任务上却并不可靠,在概念提取和说话人理解方面表现不佳,而 Gemma-4-31B 的表现更好。

0 人收藏 0 人点赞
#benchmarks

要想反对AI,你实际上需要了解如今的AI是什么。

Reddit r/artificial · 2天前

作者认为,可信的反AI立场需要理解当前前沿模型的能力,并引用GDPval等基准以及Opus 5和ChatGPT 6等模型,表明AI在有边界的任务上已超越大多数人类。

0 人收藏 0 人点赞
#benchmarks

LFM2.5-2.6B 模型+KV缓存量化报告

Reddit r/LocalLLaMA · 2天前

关于使用多种 GGUF 和 KV 缓存量化方式对 LiquidAI 的 LFM2.5-2.6B 模型进行量化的详细报告,显示该模型可适配 8GB 树莓派且性能下降极小,但提醒不要使用 Q4_K_M。

0 人收藏 0 人点赞
#benchmarks

无需 Rollout 的任务难度预测

arXiv cs.LG · 3天前 缓存

本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。

0 人收藏 0 人点赞
#benchmarks

提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时变化

arXiv cs.AI · 3天前 缓存

本文研究了提示侧智能体剧本(从先前运行中提炼出的流程)是否能在不同设置之间迁移,发现冻结迁移仅在有条件下有效,具体取决于与目标部署的兼容性;在ALFWorld、TAU2-Bench和XBench-DeepSearch上的结果参差不齐。

0 人收藏 0 人点赞
#benchmarks

智能体自驱动显微镜基准测试支持资格认证,但未必能泛化到未见任务

arXiv cs.AI · 3天前 缓存

本文介绍了一个基准测试与轨迹记录框架,用于评估控制显微镜的基于LLM的智能体,比较了105种智能体配置,发现基准测试有助于资格验证,但无法可靠预测智能体在未见任务上的表现。

0 人收藏 0 人点赞
#benchmarks

我如何仅用24GB内存运行193B参数模型

Reddit r/ArtificialInteligence · 3天前

介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。

0 人收藏 0 人点赞
#benchmarks

面向AI安全的项目反应理论

arXiv cs.AI · 4天前 缓存

本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。

0 人收藏 0 人点赞
#benchmarks

@llama_index: “OCR 现在只是一个功能。前沿模型将吞噬它。”我们不断听到这种说法。数据却表明并非如此。在三个……

X AI KOLs Following · 4天前 缓存

LlamaIndex 认为,文档 OCR 并未被前沿模型商品化,基准数据显示专业解析器仍然更准确且成本更低。

0 人收藏 0 人点赞
#benchmarks

三款大型AI模型都出了同样的故障?

Reddit r/singularity · 5天前

一篇批判性分析指出,OpenAI、Anthropic 和 xAI 的主要 AI 模型存在一个共同失败:后训练的过度优化导致模型不遵循用户指令,而各公司发布的是退化版本,并把用户当作测试人员。

0 人收藏 0 人点赞
#benchmarks

每个错误答案都算数:LLM 多选题基准的选项级心理测量学

arXiv cs.CL · 5天前 缓存

本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。

0 人收藏 0 人点赞
#benchmarks

JudgeArena:可复现的LLM裁判评估统一框架

arXiv cs.CL · 5天前 缓存

JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。

0 人收藏 0 人点赞
#benchmarks

评估OpenAI隐私过滤器:跨语言、跨领域的42个基准上的PII检测

arXiv cs.CL · 5天前 缓存

本文首次对OpenAI隐私过滤器(OPF)——一个15亿参数的个人身份信息(PII)检测器——进行了独立的系统性评估,涵盖22种语言、5个领域的42个基准,并与Presidio、GLiNER、GPT-4o和XLM-RoBERTa进行了比较。主要发现包括:OPF在结构化合成PII上表现强劲,但在非拉丁文字和叙事性散文中性能严重下降。

0 人收藏 0 人点赞
#benchmarks

干扰物感知截断:在长上下文LLM基准测试中解耦上下文长度效应与信号丢失

arXiv cs.AI · 5天前 缓存

本文引入了干扰物感知截断,以在长上下文LLM基准测试中将上下文长度效应与信号丢失分离开来,表明朴素截断将两者混为一谈,而保留任务相关内容并移除干扰物则能维持或提升性能。

0 人收藏 0 人点赞
#benchmarks

可达性并非实现:追踪LLM基准测试提升的来源

arXiv cs.AI · 5天前 缓存

本文介绍了一种问题级审计框架,用于区分LLM基准测试中的“已实现”答案与“可达”答案,表明总体得分提升往往来自生成已经可达的答案,而非扩展真实能力,并且在匹配预算下,随机层路由与结构化搜索表现相当。

0 人收藏 0 人点赞
#benchmarks

On the missing benchmarks layer and a potential solution

arXiv cs.AI · 5天前 缓存

This paper argues that Latin America lacks a benchmark layer for native AI development and proposes an open, task-first EvalsHub infrastructure, with LatamBoard as its first regional instance, to audit AI systems and direct optimization toward local needs.

0 人收藏 0 人点赞
#benchmarks

On the missing data layer and a potential solution

arXiv cs.AI · 5天前 缓存

This paper argues that Latin America lacks the datasets and benchmarks layers needed to build its own AI, and proposes DataHub, an open, incentive-driven platform with a task-first ontology to index and contribute regional datasets.

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈