标签
OpenAI 的 Agents API 引入了管理的代理运行时,提出了哪些工件应保持可检查的问题,以确保此类系统的可重复性和信任。
Tahuna是一个开源的AI训练基础设施,专为小团队设计,用于训练模型、运行推理、编排GPU并进行自主研究实验,具有可重现的运行和如Hillclimb这样的工具。
本文介绍了XAI-Arena,这是一个LLM-as-a-judge框架,用于可扩展和可复现的AI解释质量评估,显示出与人类判断的强相关性。
本文介绍了 AgentActionBench,一个过程导向的基准测试,用于评估 LLM 智能体在机器学习和 AI4Science 领域从科学论文中复现实验的能力。
首个 Guix-Science 频道的发布为 Guix 包管理器提供了一个专门的、社区驱动的科学软件目录,增强了科学计算的可重复性和协作性。
一篇观点文章指出,机器学习研究中的可复现性正濒临失效,原因在于实体AI需要昂贵硬件、科技巨头发布了难以验证的性能数据,以及竞争压力使得作者不愿分享代码。
本文提出一个六阶段审计框架,用于评估神经符号AI文献的可复现性,发现仅有6.5%的已发布工件研究可被复现,凸显了研究可复现性的危机。
一个用于语言模型的可重现测试系统,该系统基于风险阈值评估续接门控,展示了在前沿模型如GPT-5.4和GPT-5.6-sol上的一致行为。
Flower Hub 是一个可复现的联邦学习基准测试平台,支持在模拟和部署运行时环境中执行和评估任务。
本文提出主张锁定报告,一种先溯源后成文的协议,通过在大语言模型生成前固定统计证据,以提高科学报告的可重复性和准确性。
本文提出一种可复现且符合许可证要求的知识蒸馏方法,用于创建可在CPU硬件上运行的高效大语言模型安全分类器。该方法在降低误报率的同时,实现了与大型模型相当的性能表现。
这篇文章讨论了AAAI 2027审稿过程中的串通行为,特别是审稿人分配循环,并批评了顶级AI会议接受论文中缺乏代码发布的问题。
本文引入了检索增强问答系统中忽略准确率的答案波动现象,并提出了快照兼容性审计,用于在语料库更新时检测隐藏的答案变化,即使整体准确率看似稳定。
Brain Researcher是一个代理平台,通过强制执行分析严谨性、提高工具选择准确性和确保可重复性来增强AI驱动的神经影像数据分析。该研究展示了显著的性能提升,并将方法论判断集成到工作流程中。
本文分析了AQuA关于AI代理递归自我提升的预印本,阐明代理LM保持固定而研究状态更新,并倡导进行详细的消融研究和工件共享,以实现可信的本地模型移植。
本文提出一个基于FitLayout的平台,用于创建网页的视觉感知表示,以支持机器学习应用。通过图神经网络识别关键内容元素,展示了其应用。
文章讨论了使AI模型中的上传者运行的拒绝表独立可复现的要求,强调了需要详细的复制包,包括原始生成、解码设置、每个提示的标签和评分代码。
一项可重复性研究揭示了在Pre-LN Transformer中移除残差连接时产生的非对称效应:移除注意力跳跃导致崩溃,而移除FFN跳跃在较小规模下允许部分恢复。
Agent Lightning v1.0 是一个轻量级框架,为代理环境启用可重现的强化学习,显著提升编码代理在如SWE-bench Verified等基准测试上的性能。