标签
IBBench-Light 是一个配对评估基准,用于测试大型语言模型如何基于用户请求处理外部指令,揭示了在评估任务条件化响应时,边际准确性可能具有误导性。
Artificial Analysis 发布了 Intelligence Index v4.2,这是一个临时更新,包含新评估如 AA-Briefcase 和 GDP.pdf,增加了私人测试集以防止作弊,关键结果显示 Anthropic 和 OpenAI 领先。
本文探讨了OpenAI的Astra模型在ARC Prize基准测试中的分数不一致性,强调了不同测试框架的差异以及OpenAI发布页面的更改,引发了对评估准确性的担忧。
本研究调查了LLM评审者中基于能力的偏见,并引入了一种校准的加权多数投票集成方法,以在不需要标注数据的情况下提高自动化评估的可靠性。
一个提示,使用三个特定的绘图测试——鹈鹕骑自行车、Sun Wukong 开飞机和 Qin Shi Huang 骑北极熊——来评估AI模型的智能是否随时间变化。
ModaLens是一种配对图像交换审计方法,用于测量报告可用性如何降低医学视觉语言模型中的图像敏感性,通过在MIMIC-CXR数据集上使用MedGemma-27B进行演示。
Nex-N2.5-mini-MLX-4bit 模型在 Apple M5 Max 硬件上的基准测试结果,生成速度达到 133.6 tokens/s,研究任务中的质量分数高达 85.80。
这篇文章通过解释其方法论,并以Deepseek V4.1-Flash等例子为例,证明了单独的评估比聚合分数提供更细致的见解,从而捍卫了Artificial Analysis的基准测试。
关于在两块RTX 4090 GPU上使用llama.cpp并发运行多个AI代理的基准测试报告,揭示了性能限制和Qwen模型的最佳配置。
Artificial Analysis 已将其 Intelligence Index 更新至 4.3 版本,新增了 Terminal-Bench v4.0 和 AutomationBench-AA 等基准测试,以更好地评估 AI 模型的性能和成本效率。
该推文反对公司因 AI 安全事件(如 HuggingFace 事件)而停止评估或惩罚模型。
OpenAI声称GPT-6 Astra在AGI基准测试中取得99.9%的高分,实则依赖特定测试框架(Provider Adapter)达成;若使用标准框架测试,得分仅为62.7%。此举暴露出AI模型评估与基准测试透明度存在重大问题。
作者认为,像复刻 Minecraft 或生成 SVG 鹈鹕这样的病毒式“演示基准测试”很容易被过拟合,衡量的是营销准备程度而非真正的 AI 能力;并呼吁社区应依赖动态或私有评估,而非静态的公开测试。
本文对 8 个 Qwen 3.8 27B 模型的 abliterated 变体与基座模型进行了全面基准测试,消耗 167 GPU 小时,涵盖权重分析、KL 散度、13 项基准测试及 HarmBench 拒绝测试。分析表明,精细化编辑显著优于大幅修改:激进的 abliteration 会导致模型在多达 45% 的对抗性响应中陷入思考循环,且部分变体中检测到聊天模板操纵。
Aikido Security 在网络安全数据集上对 GPT-6 Astra 进行了基准测试,在 pass@3 条件下重新发现了 32 个 CVE 中的 29 个,创下了史上最高召回率,比 GPT-5.6-Sol 还多出 4 个;不过三次评测运行花费了近 4000 美元。
E-Commerce Bench 是阿里巴巴 Qwen 团队推出的一个新基准,用于评估 AI 模型在电子商务长期自主业务操作中的表现,初始资金为 ¥100,000,用于运营在线商店 365 天。
本文详细描述了对15个模型进行的AI基准测试重新运行,纠正了先前的错误,并分析了多语言定价任务中的准确性、成本和写作质量等因素。
本文提出了一种无源方法,用于诊断遗忘类别是否可以在类别遗忘后恢复,引入了无源重学习审计(SFRA)和一个重学习分数来量化可恢复性。
本文表明,在指令调优中,输出格式混淆了数据质量指标和模型能力评估,导致显著的精度偏移,并使得当前方法在缺乏接口感知调整时失效。