标签
一位用户报告称,尽管 DeepSeek-V4-Flash-0731 在基准测试中得分很高,但在摘要、会议记录等非编程办公任务上却并不可靠,在概念提取和说话人理解方面表现不佳,而 Gemma-4-31B 的表现更好。
monday.com 工程总监 Dor Cohen 将在 Interrupt London 上分享如何利用 LangSmith 生产环境追踪构建一个双流水线 LLM 评估系统,用于在线和离线评估。
本文提出HallDetect,一种轻量级、无需参考的幻觉检测框架,它将生成内容分解为原子声明,并通过紧凑的蕴含模型进行验证。在多个基准测试中,它优于资源相当的基础模型,并提供了从声明到文本片段的审计轨迹。
一项对32个本地语言模型在事实提取语料库上的正面交锋评估发现,大多数模型在统计上难以区分,而LFM2.5模型尽管规模更大,表现却显著更差。
一项并排编码实验对比了GPT-5.6 Luna与DeepSeek V4 Flash,结果显示,在计入重试后,DeepSeek看似5倍的价格优势大幅缩水。文章主张采用更全面的基准测试,报告每次尝试的成本和每次验证成功的成本。
IslamicTurathBench(ISTB)是一个新的多任务、多学科基准,用于评估大语言模型在古典伊斯兰学术上的表现,包含 3,465 道专家审核的题目,涵盖 35 部著作和七个领域。
本文介绍了ProverbIT,一个包含100道多选题的新型意大利语基准,用于测试LLM完成谚语的能力。通过对13个模型的评估,研究发现,在没有正确答案的多选题格式中,模型性能显著下降,这表明模型依赖记忆模式而非深层的语义理解。
这篇arXiv论文评估了推理型大语言模型的心智理论能力,发现其对提示变化和任务扰动的稳健性有所提高。作者将这一增益解读为支持基于稳健性的解释,而非新的ToM特定能力。
Introduces CROWN-QA, a benchmark for completeness-sensitive negative reasoning in LLMs, showing models struggle to distinguish justified negative answers from insufficient evidence, often over-closing.
FinReportBench 是一个基于专家经验的基准测试,用于衡量和改进机构级财务报告生成,包含 35 项可观察标准,涵盖可交付性、报告身份和机构完整性。它精选了 244 个双语任务,评估了九个模型家族,并使用基准引导的技能蒸馏来改进五个模型家族的生成和自我审查能力。
本文表明,大语言模型表面上的自我纠正增益往往源于格式修复,而非推理能力的提升。在多种模型规模下,格式效应主导内容效应,且在能力较强的模型上内容边际接近零,这表明该领域将少数实测的自我纠正误归因于实际的内容改进。
本文研究MGSM上原生语言与翻译之间的多语言推理差距是否是输出token预算的伪影。作者表明,在不同的硬性上限下,测得的差距显著波动,并且长度归一化可以逆转策略排序,因此得出结论:在评估中应将输出上限视为一个独立变量。
本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。
本文介绍了MatrAIx,一个利用83亿条角色记录进行人口规模模拟用户评估的基础设施,用于测试AI系统和数字产品。它提供了约100万个经质量筛选的核心角色集、多个评估环境,以及显示高角色遵循度的验证研究。
本文介绍了Alien Abduction,一个交互式游戏,用于探究大语言模型在溯因推理中如何获取证据、更新假设以及决定何时停止。研究发现,与自行选择查询相比,模型在预先提供证据和由oracle提供示例的情况下表现更好,揭示了其在主动信息获取方面的不足。
本文通过评估23个大语言模型在四个基准测试及其改进版本上的表现,检验常识基准分数是否能预测现实世界下游任务的表现,发现改进版本保持了排名,但仅提供依赖于任务的预测效度。
本文区分了LLM意见模拟中的两个任务——模拟(生成个体回复)和估计(直接预测总体分布),并发现基座模型更擅长模拟,而后训练模型更擅长估计,研究使用了皮尤美国趋势面板数据。
本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。
本文通过将匿名化的城市画像按40项指标进行评分,衡量了语言模型对“城市”所做的隐含假设,发现它们普遍偏好规模更大、增长更快、基础设施更完善的城市。研究使用开放权重检查点和可复现数据,使语言模型中城市默认画像的经验性追溯成为可能。
本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。