reproducibility

标签

Cards List
#reproducibility

@paul_cal: p-hacking又回来了

X AI KOLs Following · 2026-08-17 缓存

Ethan Mollick建议,AI生成的分析应伴随着多宇宙式报告和完整披露提示词,以增强科学的可重复性。

0 人收藏 0 人点赞
#reproducibility

推动开放和可复现的关系学习:RelArena-α、TabPFN-Rel 和 RPI

Hugging Face Daily Papers · 2026-08-17 缓存

Prior Labs 发布开源工具,包括 RelArena-α、TabPFN-Rel 和 RPI,以推进可复现的关系学习,提供统一的基准测试框架和一个基于 TabPFN 的模型。

0 人收藏 0 人点赞
#reproducibility

模型投毒与后门攻击下的联邦聚合分析:一个重建的跨数据集与跨架构基准

arXiv cs.LG · 2026-08-13 缓存

本文展示了一个重建的基准,用于分析模型投毒和后门攻击下的联邦聚合方法;结果发现 Trimmed Mean 在干净设置下最准确,Krum 在攻击下最鲁棒,同时审计了指标实现并指出了可复现性方面的注意事项。

0 人收藏 0 人点赞
#reproducibility

我们通过复现ICML的2,200篇论文学到了什么

Hugging Face Blog · 2026-08-13 缓存

Hugging Face 分享了社区黑客马拉松的发现,1200名参与者使用编码代理复现了2,226篇ICML论文,凸显了评审严谨性问题以及AI代理扩展验证的潜力。

0 人收藏 0 人点赞
#reproducibility

AAAI 2027 审稿:没有代码提交?[D]

Reddit r/MachineLearning · 2026-08-11

一位 AAAI 2027 的审稿人对提交论文中附带代码的数量之少感到惊讶,尽管会议强调可复现性,并询问缺乏代码是否应影响审稿评分。

0 人收藏 0 人点赞
#reproducibility

所有大语言模型都知道自己何时有害吗?跨模型家族的潜在空间安全探针可重复性研究

arXiv cs.LG · 2026-08-11 缓存

对Khatri等人提出的潜在空间安全探针进行可重复性研究,检验其跨模型家族的泛化能力以及对非确定性的敏感性。结果表明,这些探针可扩展到其他模型并获得相似的F1分数,且最终token的潜在向量在不同随机种子下保持一致。

0 人收藏 0 人点赞
#reproducibility

对铁硫簇上 SQD/QSCI 量子化学基准的自旋审计

Hacker News Top · 2026-08-06

作者对 IBM 的 SQD/QSCI 铁硫簇基准进行了独立的自旋审计,发现量子结果收敛到高自旋态而非目标单重态。利用 IBM 自己存档的硬件数据,他们展示了随附的缓解措施未能解决自旋问题,并提供了 Claude 辅助的审查。

0 人收藏 0 人点赞
#reproducibility

JudgeArena:可复现的LLM裁判评估统一框架

arXiv cs.CL · 2026-08-05 缓存

JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。

0 人收藏 0 人点赞
#reproducibility

Nix 沙盒是一个隐藏输入

Lobsters Hottest · 2026-08-04 缓存

一篇技术深度文章,探讨 Nix 的沙盒路径如何作为派生的隐藏输入,从而破坏可重现性:即使相同的派生,也可能因沙盒配置不同而产生不同的输出。

0 人收藏 0 人点赞
#reproducibility

是时候对不包含可复现结果代码的论文进行直接拒稿了 [D]

Reddit r/MachineLearning · 2026-08-03

作者在为三大顶级会议审稿后,认为没有提供代码以复现结果的论文应被直接拒稿,并指出其审阅的12篇论文中仅1篇提供了完整代码,7篇未提供任何代码。

0 人收藏 0 人点赞
#reproducibility

EEG情绪识别中的评估协议与跨受试者泛化

arXiv cs.LG · 2026-07-31 缓存

本文以SEED和SEED-IV数据集上的DGCNN为例,研究了评估协议如何影响EEG情绪识别中报告的准确率。研究表明,受试者相关(subject-dependent)、跨受试者(subject-disjoint)和跨会话(cross-session)评估回答的是不同问题,而检查点选择(checkpoint selection)和测试集重用可能会虚增准确率。

0 人收藏 0 人点赞
#reproducibility

ECG-InterpBench:使用匹配尺度稀疏自编码器对ECG基础模型可解释性进行基准测试

arXiv cs.LG · 2026-07-31 缓存

ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。

0 人收藏 0 人点赞
#reproducibility

The Age of AI Agents Demands A New Scientific Paradigm To Sustain Trustworthy Science

arXiv cs.AI · 2026-07-31 缓存

A position paper arguing that autonomous AI agents in science widen the verification gap and that scientific verification infrastructure must evolve with observable-by-default workflows, scalable verification, and clear attribution to sustain trustworthy science.

0 人收藏 0 人点赞
#reproducibility

放射学视觉语言模型基准的取证可重复性审计:从预期协议到发布产物

arXiv cs.AI · 2026-07-31 缓存

本文对放射学视觉语言模型基准进行了取证式可重复性审计,发现预期协议与发布产物之间存在差异,这些差异使原始声明失效。作者提出了一种基准合约,以暴露此类失败类别。

0 人收藏 0 人点赞
#reproducibility

使用Nix构建系统软件

Lobsters Hottest · 2026-07-28 缓存

一篇博客文章,讨论Nix如何帮助解决构建系统软件时的依赖和可重现性问题,特别是针对像BPF和io_uring这样快速演进的子系统。

0 人收藏 0 人点赞
#reproducibility

表格数据上经典机器学习的缩放定律:一项基准研究

arXiv cs.LG · 2026-07-27 缓存

本文对表格数据上经典机器学习模型的缩放定律进行了一项分布式基准研究,结果表明幂律拟合适用于大多数模型家族,并量化了127名学生运行中复制者实现的差异。

0 人收藏 0 人点赞
#reproducibility

STeMP: 时空建模协议

arXiv cs.LG · 2026-07-24 缓存

STeMP是一种标准化协议,用于报告和指导环境研究中的时空预测机器学习建模,旨在提高透明度和可重复性。该协议附有R包和网络应用程序,并托管在GitHub上。

0 人收藏 0 人点赞
#reproducibility

你的LLM功能可能不是确定性的,而你却不知道。我在开发一个金融科技AI时学到的:如何让AI给出相同的答案两次

Reddit r/ArtificialInteligence · 2026-07-22

一位开发者分享了在让分析交易图表的AI给出一致答案时学到的经验。修复方法包括将温度设置为0并在所有管道阶段使用固定种子,并强调确定性是一种信任特性,必须与基于真实数据的接地相结合。

0 人收藏 0 人点赞
#reproducibility

大规模提示设计:格式、指令数量和上下文长度如何影响大型语言模型的指令遵循与幻觉

arXiv cs.CL · 2026-07-22 缓存

本文通过在合成语料库上进行受控实验,研究了格式、指令数量和上下文长度如何影响大型语言模型(LLM)的指令遵循与幻觉。研究发现,无论何种格式,当规则数量超过80条时,指令遵循会崩溃;而回忆准确率在64-128k token之后急剧下降,且受格式影响。本文还发布了VeyraBench工具包以支持复现。

0 人收藏 0 人点赞
#reproducibility

PsiLogic:一种面向Adam的混沌感知主动取消方法及公平跨域基准

arXiv cs.LG · 2026-07-21 缓存

介绍了PsiLogic,一种基于梯度不稳定性动态阻尼项增强Adam的混沌感知优化器,并提出了FairBench以实现可复现评估。在NLP、ViT和ResNet任务上展示了具有竞争力或更优的结果,并对局限性保持完全透明。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈