research-critique

标签

Cards List
#research-critique

深度强化学习评估与设计范式的原则性分析

arXiv cs.LG · 2026-07-10 缓存

本文分析了深度强化学习中的评估与设计范式,揭示了性能排名在不同数据范围下并非单调递增,且常见的低数据范围基准可能导致错误结论。

0 人收藏 0 人点赞
#research-critique

科学家声称微软的“量子飞跃”因基本的Python错误而无效

Hacker News Top · 2026-06-24 缓存

一位科学家在《自然》杂志上发表了一篇经同行评审的批评文章,指出微软关于量子计算突破的宣称因基本的Python错误和遗漏的数据而无效,表明该公司的拓扑量子计算机远未实现。

0 人收藏 0 人点赞
#research-critique

MLE-Bench 的性能提升:算法贡献 vs. 更好的模型与更多搜索?[R]

Reddit r/MachineLearning · 2026-06-01

一项新基准 FML-Bench 揭示,近期 MLE-Bench 分数的提升主要归因于更好的基础模型和增加的搜索预算,而非算法进步。

0 人收藏 0 人点赞
#research-critique

预测瓶颈无法发现因果结构(但它们实际上能做什么)

Hugging Face Daily Papers · 2026-05-09 缓存

本文质疑了诸如 Mamba 等模型中的预测瓶颈能够恢复因果结构的说法,并通过一个新的基准测试证明,其性能提升主要归因于混杂因素和鲁棒性伪影,而非真正的因果发现。

0 人收藏 0 人点赞
#research-critique

对机械可解释性研究的幻灭 [D]

Reddit r/MachineLearning · 2026-05-08

一位本科生研究员对Anthropic最近的机械可解释性研究表达了幻灭感,具体批评其新的自然语言自编码器方法是一种黑箱技术,且缺乏与稀疏自编码器基线之间的严格指标比较。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈