标签
本文分析了深度强化学习中的评估与设计范式,揭示了性能排名在不同数据范围下并非单调递增,且常见的低数据范围基准可能导致错误结论。
一位科学家在《自然》杂志上发表了一篇经同行评审的批评文章,指出微软关于量子计算突破的宣称因基本的Python错误和遗漏的数据而无效,表明该公司的拓扑量子计算机远未实现。
一项新基准 FML-Bench 揭示,近期 MLE-Bench 分数的提升主要归因于更好的基础模型和增加的搜索预算,而非算法进步。
本文质疑了诸如 Mamba 等模型中的预测瓶颈能够恢复因果结构的说法,并通过一个新的基准测试证明,其性能提升主要归因于混杂因素和鲁棒性伪影,而非真正的因果发现。
一位本科生研究员对Anthropic最近的机械可解释性研究表达了幻灭感,具体批评其新的自然语言自编码器方法是一种黑箱技术,且缺乏与稀疏自编码器基线之间的严格指标比较。