ai-research

标签

Cards List
#ai-research

立场:LLMs 无法跳跃

Hacker News Top · 3天前 缓存

一篇立场论文,认为大语言模型存在根本性局限,用“无法跳跃”这一隐喻来突出推理或泛化方面的不足。

0 人收藏 0 人点赞
#ai-research

基准测试的基准测试:检验常识基准的预测效度

arXiv cs.CL · 4天前 缓存

本文通过评估23个大语言模型在四个基准测试及其改进版本上的表现,检验常识基准分数是否能预测现实世界下游任务的表现,发现改进版本保持了排名,但仅提供依赖于任务的预测效度。

0 人收藏 0 人点赞
#ai-research

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL · 4天前 缓存

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。

0 人收藏 0 人点赞
#ai-research

通过语言模型的视角描绘城市

arXiv cs.CL · 4天前 缓存

本文通过将匿名化的城市画像按40项指标进行评分,衡量了语言模型对“城市”所做的隐含假设,发现它们普遍偏好规模更大、增长更快、基础设施更完善的城市。研究使用开放权重检查点和可复现数据,使语言模型中城市默认画像的经验性追溯成为可能。

0 人收藏 0 人点赞
#ai-research

Gwern 从全职写作退休,创办 Guardian Angel Inc

Hacker News Top · 4天前

Gwern 宣布他将从全职写作退休,创办一家新公司 Guardian Angel Inc。

0 人收藏 0 人点赞
#ai-research

@nkwang24:1/ 好奇像@biohub的ESM-C这样的蛋白质语言模型如何仅从序列中表示结构信息?来…

X AI KOLs Timeline · 4天前 缓存

Goodfire的Silico研究平台现已公开可用,其演示展示了蛋白质语言模型(如ESM-C)如何仅从序列表示结构信息,从而支持前沿规模模型的解释与训练。

0 人收藏 0 人点赞
#ai-research

NVIDIA加入NSF州级和区域AI中心计划,以扩大全美的AI研究与教育

NVIDIA Blog · 4天前 缓存

NVIDIA加入NSF州级和区域AI基础设施中心计划,为美国高校和学院的研究与教育扩大AI计算、数据和专业知识的获取范围。

0 人收藏 0 人点赞
#ai-research

反应式玩法:实现了!!Atari Breakout 实验 [R]

Reddit r/MachineLearning · 4天前

在 Atari Breakout 上进行了 123 次失败的 PPO 实验后,添加一个简单的接近奖励来追踪球的下落,最终实现了反应式的、非脚本化的玩法,并且能够迁移到不熟悉的砖块布局上。

0 人收藏 0 人点赞
#ai-research

MetaRoute-Bench:评估智能体工作流路由的元决策策略

arXiv cs.LG · 5天前 缓存

本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。

0 人收藏 0 人点赞
#ai-research

@furongh:RL 与蒸馏可能是一个伪二分法。一种后训练抽象:将 RL 视为监督的编译器。使用策略…

X AI KOLs Timeline · 5天前 缓存

本推文串介绍了 β-OPSD,一种后训练抽象,它将 RL 视为监督的编译器,使用策略优化来推导目标,并使用蒸馏进行训练。

0 人收藏 0 人点赞
#ai-research

ContinualSkillBench:LLM智能体能否真正进化其能力?

Hugging Face Daily Papers · 5天前 缓存

介绍了ContinualSkillBench,一个用于LLM智能体上下文内持续技能学习的动态评估框架,表明虽然顺序执行能提升性能,但当前方法难以将经验巩固为稳健、可迁移的技能。

0 人收藏 0 人点赞
#ai-research

@rohanpaul_ai:价值2000美元的token比送两个人去参加会议还便宜,而这个差距正是改变开放问题计算方式的关键……

X AI KOLs Following · 5天前 缓存

OpenAI 报告称,其下一代主要模型的内部版本(Astra)以约2000美元的token成本,解决了数学和理论计算机科学领域10个长期悬而未决的开放问题,并附有正式的Lean证书。

0 人收藏 0 人点赞
#ai-research

有没有人也对Google DeepMind未能在这些数学基准测试中领先感到惊讶?

Reddit r/singularity · 5天前

作者对Google DeepMind尽管在该领域有过基础性工作,却未能在数学AI基准测试中领先表示惊讶,同时提到OpenAI最近的进展。

0 人收藏 0 人点赞
#ai-research

@OpenAI:我们正在发布手稿、正式的 Lean 证书和推理演练,以便数学家们可以檢視这些…

X AI KOLs · 5天前 缓存

OpenAI 发布了十项由 AI 在数学和理论计算机科学领域取得的进展的手稿、正式的 Lean 证书和推理演练,其中包括球体堆积、非 sofic 群和量子并行重复方面的结果。

0 人收藏 0 人点赞
#ai-research

@OpenAI: 我们下一个主要模型的内部版本在数学和理论计算机科学的长期开放问题上产生了10项新成果……

X AI KOLs Following · 5天前 缓存

OpenAI 的内部下一代主要模型在数学和理论计算机科学的长期开放问题上产生了10项新成果,按 GPT-5.6 Sol API 价格计算,使用了价值约 2,000 美元的 token。

0 人收藏 0 人点赞
#ai-research

WorldExam:从表观外观到内在反应性的世界模型基准评测

Hugging Face Daily Papers · 6天前 缓存

WorldExam 是一个新的分层基准,用于评估可控视频生成中的世界模型,涵盖视觉质量、控制遵循、空间一致性和世界反应性。对20个模型的测试表明,高视觉质量和指令完成并不保证内在反应性。

0 人收藏 0 人点赞
#ai-research

数学危机与AI学术的前景

Reddit r/singularity · 6天前 缓存

一位哲学家关于AI推理模型如何颠覆数学、解决长期悬而未决的猜想并迫使学术界重新思考研究未来的文章。

0 人收藏 0 人点赞
#ai-research

neurips 2026:AC和审稿人消失了 [D]

Reddit r/MachineLearning · 6天前

一份NeurIPS 2026投稿的作者报告称,他们在讨论期正式开始前通过“Rebuttal”按钮提前提交了反驳意见,随后审稿人和AC都沉默了,双方没有收到任何通知,而讨论期只剩一天,让他们焦虑不安。

0 人收藏 0 人点赞
#ai-research

@sheriyuo: 前 OpenAI 推理负责人 JT 与 Gemini 预训练负责人 Rohan:持续学习的未来 https://mp.weixin.qq.com/s/-5raMxvw0sAK-IPGXRaijA…

X AI KOLs Timeline · 6天前 缓存

前 OpenAI 推理负责人 JT 与 Gemini 预训练负责人 Rohan 探讨持续学习的未来发展方向。

0 人收藏 0 人点赞
#ai-research

Anthropic员工使用Fable成功复现了10个Astra证明中的5个

Reddit r/singularity · 6天前

一位Anthropic员工声称使用Fable复现了10个Astra证明中的5个,但未提供实际证明,这引发质疑:为何专注于复现而不是解决新的开放问题。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈