标签
Ethan Mollick建议,AI生成的分析应伴随着多宇宙式报告和完整披露提示词,以增强科学的可重复性。
Prior Labs 发布开源工具,包括 RelArena-α、TabPFN-Rel 和 RPI,以推进可复现的关系学习,提供统一的基准测试框架和一个基于 TabPFN 的模型。
本文展示了一个重建的基准,用于分析模型投毒和后门攻击下的联邦聚合方法;结果发现 Trimmed Mean 在干净设置下最准确,Krum 在攻击下最鲁棒,同时审计了指标实现并指出了可复现性方面的注意事项。
Hugging Face 分享了社区黑客马拉松的发现,1200名参与者使用编码代理复现了2,226篇ICML论文,凸显了评审严谨性问题以及AI代理扩展验证的潜力。
一位 AAAI 2027 的审稿人对提交论文中附带代码的数量之少感到惊讶,尽管会议强调可复现性,并询问缺乏代码是否应影响审稿评分。
对Khatri等人提出的潜在空间安全探针进行可重复性研究,检验其跨模型家族的泛化能力以及对非确定性的敏感性。结果表明,这些探针可扩展到其他模型并获得相似的F1分数,且最终token的潜在向量在不同随机种子下保持一致。
作者对 IBM 的 SQD/QSCI 铁硫簇基准进行了独立的自旋审计,发现量子结果收敛到高自旋态而非目标单重态。利用 IBM 自己存档的硬件数据,他们展示了随附的缓解措施未能解决自旋问题,并提供了 Claude 辅助的审查。
JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。
一篇技术深度文章,探讨 Nix 的沙盒路径如何作为派生的隐藏输入,从而破坏可重现性:即使相同的派生,也可能因沙盒配置不同而产生不同的输出。
作者在为三大顶级会议审稿后,认为没有提供代码以复现结果的论文应被直接拒稿,并指出其审阅的12篇论文中仅1篇提供了完整代码,7篇未提供任何代码。
本文以SEED和SEED-IV数据集上的DGCNN为例,研究了评估协议如何影响EEG情绪识别中报告的准确率。研究表明,受试者相关(subject-dependent)、跨受试者(subject-disjoint)和跨会话(cross-session)评估回答的是不同问题,而检查点选择(checkpoint selection)和测试集重用可能会虚增准确率。
ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。
A position paper arguing that autonomous AI agents in science widen the verification gap and that scientific verification infrastructure must evolve with observable-by-default workflows, scalable verification, and clear attribution to sustain trustworthy science.
本文对放射学视觉语言模型基准进行了取证式可重复性审计,发现预期协议与发布产物之间存在差异,这些差异使原始声明失效。作者提出了一种基准合约,以暴露此类失败类别。
一篇博客文章,讨论Nix如何帮助解决构建系统软件时的依赖和可重现性问题,特别是针对像BPF和io_uring这样快速演进的子系统。
本文对表格数据上经典机器学习模型的缩放定律进行了一项分布式基准研究,结果表明幂律拟合适用于大多数模型家族,并量化了127名学生运行中复制者实现的差异。
STeMP是一种标准化协议,用于报告和指导环境研究中的时空预测机器学习建模,旨在提高透明度和可重复性。该协议附有R包和网络应用程序,并托管在GitHub上。
一位开发者分享了在让分析交易图表的AI给出一致答案时学到的经验。修复方法包括将温度设置为0并在所有管道阶段使用固定种子,并强调确定性是一种信任特性,必须与基于真实数据的接地相结合。
本文通过在合成语料库上进行受控实验,研究了格式、指令数量和上下文长度如何影响大型语言模型(LLM)的指令遵循与幻觉。研究发现,无论何种格式,当规则数量超过80条时,指令遵循会崩溃;而回忆准确率在64-128k token之后急剧下降,且受格式影响。本文还发布了VeyraBench工具包以支持复现。
介绍了PsiLogic,一种基于梯度不稳定性动态阻尼项增强Adam的混沌感知优化器,并提出了FairBench以实现可复现评估。在NLP、ViT和ResNet任务上展示了具有竞争力或更优的结果,并对局限性保持完全透明。