reproducibility

标签

Cards List
#reproducibility

在代理运行时被管理的情况下,什么应该保持可检查?

Reddit r/AI_Agents · 6小时前

OpenAI 的 Agents API 引入了管理的代理运行时,提出了哪些工件应保持可检查的问题,以确保此类系统的可重复性和信任。

0 人收藏 0 人点赞
#reproducibility

踏准前沿 – Tahuna: AI训练基础设施,现已开源 [P]

Reddit r/MachineLearning · 15小时前

Tahuna是一个开源的AI训练基础设施,专为小团队设计,用于训练模型、运行推理、编排GPU并进行自主研究实验,具有可重现的运行和如Hillclimb这样的工具。

0 人收藏 0 人点赞
#reproducibility

XAI-Arena:大语言模型能否评估XAI解释的质量?

arXiv cs.AI · 3天前 缓存

本文介绍了XAI-Arena,这是一个LLM-as-a-judge框架,用于可扩展和可复现的AI解释质量评估,显示出与人类判断的强相关性。

0 人收藏 0 人点赞
#reproducibility

NLPCC 2026 共享任务 11 概览:从科学论文中基于智能体的实验复现

arXiv cs.CL · 3天前 缓存

本文介绍了 AgentActionBench,一个过程导向的基准测试,用于评估 LLM 智能体在机器学习和 AI4Science 领域从科学论文中复现实验的能力。

0 人收藏 0 人点赞
#reproducibility

宣布首个 Guix-Science 版本发布

Lobsters Hottest · 4天前 缓存

首个 Guix-Science 频道的发布为 Guix 包管理器提供了一个专门的、社区驱动的科学软件目录,增强了科学计算的可重复性和协作性。

0 人收藏 0 人点赞
#reproducibility

可复现性在机器学习研究中似乎正变得无关紧要。是否为时已晚?[D]

Reddit r/MachineLearning · 2026-09-06

一篇观点文章指出,机器学习研究中的可复现性正濒临失效,原因在于实体AI需要昂贵硬件、科技巨头发布了难以验证的性能数据,以及竞争压力使得作者不愿分享代码。

0 人收藏 0 人点赞
#reproducibility

神经符号文献中仅6.5%可通过其发布工件复现:一个六阶段审计框架及其首次实例化

arXiv cs.AI · 2026-08-28 缓存

本文提出一个六阶段审计框架,用于评估神经符号AI文献的可复现性,发现仅有6.5%的已发布工件研究可被复现,凸显了研究可复现性的危机。

0 人收藏 0 人点赞
#reproducibility

我制作了一个可克隆和破解的LLM测试

Reddit r/artificial · 2026-08-27 缓存

一个用于语言模型的可重现测试系统,该系统基于风险阈值评估续接门控,展示了在前沿模型如GPT-5.4和GPT-5.6-sol上的一致行为。

0 人收藏 0 人点赞
#reproducibility

Flower Hub:一个用于联邦学习模拟与部署的可复现基准测试平台

arXiv cs.LG · 2026-08-27 缓存

Flower Hub 是一个可复现的联邦学习基准测试平台,支持在模拟和部署运行时环境中执行和评估任务。

0 人收藏 0 人点赞
#reproducibility

先溯源后成文:主张锁定报告

arXiv cs.CL · 2026-08-27 缓存

本文提出主张锁定报告,一种先溯源后成文的协议,通过在大语言模型生成前固定统计证据,以提高科学报告的可重复性和准确性。

0 人收藏 0 人点赞
#reproducibility

可复现、许可证感知的CPU可部署安全分类蒸馏方案

arXiv cs.AI · 2026-08-25 缓存

本文提出一种可复现且符合许可证要求的知识蒸馏方法,用于创建可在CPU硬件上运行的高效大语言模型安全分类器。该方法在降低误报率的同时,实现了与大型模型相当的性能表现。

0 人收藏 0 人点赞
#reproducibility

时间序列分类中可解释人工智能软件框架的系统综述

arXiv cs.AI · 2026-08-25 缓存

本文系统综述了时间序列分类中可解释人工智能的软件框架,并比较了其特性、评估实践和限制。

0 人收藏 0 人点赞
#reproducibility

AAAI 2027 审稿人竞标与分配完整性 [讨论]

Reddit r/MachineLearning · 2026-08-24

这篇文章讨论了AAAI 2027审稿过程中的串通行为,特别是审稿人分配循环,并批评了顶级AI会议接受论文中缺乏代码发布的问题。

0 人收藏 0 人点赞
#reproducibility

同一代理,不同答案:基于重复感知的检索增强问答中语料库引发的答案波动审计

Hugging Face Daily Papers · 2026-08-24 缓存

本文引入了检索增强问答系统中忽略准确率的答案波动现象,并提出了快照兼容性审计,用于在语料库更新时检测隐藏的答案变化,即使整体准确率看似稳定。

0 人收藏 0 人点赞
#reproducibility

将分析严谨性引入科学中的代理AI:Brain Researcher神经影像数据分析平台

arXiv cs.AI · 2026-08-21 缓存

Brain Researcher是一个代理平台,通过强制执行分析严谨性、提高工具选择准确性和确保可重复性来增强AI驱动的神经影像数据分析。该研究展示了显著的性能提升,并将方法论判断集成到工作流程中。

0 人收藏 0 人点赞
#reproducibility

AQuA的“自我提升”更新研究状态,而非代理LM。本地移植应冻结什么?

Reddit r/LocalLLaMA · 2026-08-20

本文分析了AQuA关于AI代理递归自我提升的预印本,阐明代理LM保持固定而研究状态更新,并倡导进行详细的消融研究和工件共享,以实现可信的本地模型移植。

0 人收藏 0 人点赞
#reproducibility

面向机器学习应用的网页视觉感知表示

arXiv cs.LG · 2026-08-20 缓存

本文提出一个基于FitLayout的平台,用于创建网页的视觉感知表示,以支持机器学习应用。通过图神经网络识别关键内容元素,展示了其应用。

0 人收藏 0 人点赞
#reproducibility

什么能使上传者运行的拒绝表独立可复现?

Reddit r/LocalLLaMA · 2026-08-18

文章讨论了使AI模型中的上传者运行的拒绝表独立可复现的要求,强调了需要详细的复制包,包括原始生成、解码设置、每个提示的标签和评分代码。

0 人收藏 0 人点赞
#reproducibility

Pre-LN Transformer中部分残差消融的可重复性研究

arXiv cs.LG · 2026-08-18 缓存

一项可重复性研究揭示了在Pre-LN Transformer中移除残差连接时产生的非对称效应:移除注意力跳跃导致崩溃,而移除FFN跳跃在较小规模下允许部分恢复。

0 人收藏 0 人点赞
#reproducibility

Agent Lightning v1.0:迈向受控的代理强化学习

Hugging Face Daily Papers · 2026-08-18 缓存

Agent Lightning v1.0 是一个轻量级框架,为代理环境启用可重现的强化学习,显著提升编码代理在如SWE-bench Verified等基准测试上的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈