标签
Jeff Geerling的基准测试显示,戴尔XPS 13中的英特尔Core 5 320在每瓦性能上与苹果硅芯片持平或超越,这表明x86在能效上可以与ARM竞争。
本文探讨了智能体记忆系统中有效时间和事务时间之间的区别,认为存储这两种时间戳对于重构智能体在特定时刻所知道的信息至关重要。文章还提议设计基准测试来检验智能体的时间推理能力。
阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。
一位用户报告称,尽管 DeepSeek-V4-Flash-0731 在基准测试中得分很高,但在摘要、会议记录等非编程办公任务上却并不可靠,在概念提取和说话人理解方面表现不佳,而 Gemma-4-31B 的表现更好。
作者认为,可信的反AI立场需要理解当前前沿模型的能力,并引用GDPval等基准以及Opus 5和ChatGPT 6等模型,表明AI在有边界的任务上已超越大多数人类。
关于使用多种 GGUF 和 KV 缓存量化方式对 LiquidAI 的 LFM2.5-2.6B 模型进行量化的详细报告,显示该模型可适配 8GB 树莓派且性能下降极小,但提醒不要使用 Q4_K_M。
本文提出在不执行昂贵 Rollout 的情况下预测 LLM 智能体的任务难度,在 17 个智能体基准上研究该问题,并表明 token 级熵是一种有用的预测信号。
本文研究了提示侧智能体剧本(从先前运行中提炼出的流程)是否能在不同设置之间迁移,发现冻结迁移仅在有条件下有效,具体取决于与目标部署的兼容性;在ALFWorld、TAU2-Bench和XBench-DeepSearch上的结果参差不齐。
本文介绍了一个基准测试与轨迹记录框架,用于评估控制显微镜的基于LLM的智能体,比较了105种智能体配置,发现基准测试有助于资格验证,但无法可靠预测智能体在未见任务上的表现。
介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。
本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。
LlamaIndex 认为,文档 OCR 并未被前沿模型商品化,基准数据显示专业解析器仍然更准确且成本更低。
一篇批判性分析指出,OpenAI、Anthropic 和 xAI 的主要 AI 模型存在一个共同失败:后训练的过度优化导致模型不遵循用户指令,而各公司发布的是退化版本,并把用户当作测试人员。
本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。
JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。
本文首次对OpenAI隐私过滤器(OPF)——一个15亿参数的个人身份信息(PII)检测器——进行了独立的系统性评估,涵盖22种语言、5个领域的42个基准,并与Presidio、GLiNER、GPT-4o和XLM-RoBERTa进行了比较。主要发现包括:OPF在结构化合成PII上表现强劲,但在非拉丁文字和叙事性散文中性能严重下降。
本文引入了干扰物感知截断,以在长上下文LLM基准测试中将上下文长度效应与信号丢失分离开来,表明朴素截断将两者混为一谈,而保留任务相关内容并移除干扰物则能维持或提升性能。
本文介绍了一种问题级审计框架,用于区分LLM基准测试中的“已实现”答案与“可达”答案,表明总体得分提升往往来自生成已经可达的答案,而非扩展真实能力,并且在匹配预算下,随机层路由与结构化搜索表现相当。
This paper argues that Latin America lacks a benchmark layer for native AI development and proposes an open, task-first EvalsHub infrastructure, with LatamBoard as its first regional instance, to audit AI systems and direct optimization toward local needs.
This paper argues that Latin America lacks the datasets and benchmarks layers needed to build its own AI, and proposes DataHub, an open, incentive-driven platform with a task-first ontology to index and contribute regional datasets.