标签
本文通过评估23个大语言模型在四个基准测试及其改进版本上的表现,检验常识基准分数是否能预测现实世界下游任务的表现,发现改进版本保持了排名,但仅提供依赖于任务的预测效度。
本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。
本文通过将匿名化的城市画像按40项指标进行评分,衡量了语言模型对“城市”所做的隐含假设,发现它们普遍偏好规模更大、增长更快、基础设施更完善的城市。研究使用开放权重检查点和可复现数据,使语言模型中城市默认画像的经验性追溯成为可能。
Gwern 宣布他将从全职写作退休,创办一家新公司 Guardian Angel Inc。
Goodfire的Silico研究平台现已公开可用,其演示展示了蛋白质语言模型(如ESM-C)如何仅从序列表示结构信息,从而支持前沿规模模型的解释与训练。
NVIDIA加入NSF州级和区域AI基础设施中心计划,为美国高校和学院的研究与教育扩大AI计算、数据和专业知识的获取范围。
在 Atari Breakout 上进行了 123 次失败的 PPO 实验后,添加一个简单的接近奖励来追踪球的下落,最终实现了反应式的、非脚本化的玩法,并且能够迁移到不熟悉的砖块布局上。
本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。
本推文串介绍了 β-OPSD,一种后训练抽象,它将 RL 视为监督的编译器,使用策略优化来推导目标,并使用蒸馏进行训练。
介绍了ContinualSkillBench,一个用于LLM智能体上下文内持续技能学习的动态评估框架,表明虽然顺序执行能提升性能,但当前方法难以将经验巩固为稳健、可迁移的技能。
OpenAI 报告称,其下一代主要模型的内部版本(Astra)以约2000美元的token成本,解决了数学和理论计算机科学领域10个长期悬而未决的开放问题,并附有正式的Lean证书。
作者对Google DeepMind尽管在该领域有过基础性工作,却未能在数学AI基准测试中领先表示惊讶,同时提到OpenAI最近的进展。
OpenAI 发布了十项由 AI 在数学和理论计算机科学领域取得的进展的手稿、正式的 Lean 证书和推理演练,其中包括球体堆积、非 sofic 群和量子并行重复方面的结果。
OpenAI 的内部下一代主要模型在数学和理论计算机科学的长期开放问题上产生了10项新成果,按 GPT-5.6 Sol API 价格计算,使用了价值约 2,000 美元的 token。
WorldExam 是一个新的分层基准,用于评估可控视频生成中的世界模型,涵盖视觉质量、控制遵循、空间一致性和世界反应性。对20个模型的测试表明,高视觉质量和指令完成并不保证内在反应性。
一份NeurIPS 2026投稿的作者报告称,他们在讨论期正式开始前通过“Rebuttal”按钮提前提交了反驳意见,随后审稿人和AC都沉默了,双方没有收到任何通知,而讨论期只剩一天,让他们焦虑不安。
前 OpenAI 推理负责人 JT 与 Gemini 预训练负责人 Rohan 探讨持续学习的未来发展方向。
一位Anthropic员工声称使用Fable复现了10个Astra证明中的5个,但未提供实际证明,这引发质疑:为何专注于复现而不是解决新的开放问题。