标签
本文在一个极简的FunSearch风格循环中引入算子包,以测试可验证搜索中数学构造问题提案器的各个组成部分,研究发现组合能够缩小差距,而排斥机制则增强了多样性。
本文展示了对TALH的探索性消融研究,TALH是一种结合MLA和SSM的混合语言模型,表明在测试设置中,SSM的集成对验证性能的影响大于MLA,并提供了关于消费级硬件上内存使用和计时的见解。
该论文介绍了MechaTerp-TRACE,一种用于语言模型组件消融分析的方法,发现实体知识主要来源于通用生成机制,而非局部组件。
本文提出了一种物理信息循环神经网络(PIRNN),通过预测不可观测的物理变量来改进物理过程的时间序列预测,并以地下水位预测为例进行演示。
本文证明,从语言模型激活中解码概念的线性探测器不一定能识别因果相关特征,并引入了使用稀疏自编码器的特征级诊断方法,以将探测器对齐与行为驱动因素分离。
本文介绍了一种多代理AI系统,用于测量和诊断LLM电子商务中的竞争可见性,采用代理搜索份额指标,并通过消融研究验证了其可行性。
这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。
本研究通过提出一种双分支、频谱门控架构(DBSG-PINN),探讨了频率分解对物理信息神经网络(PINNs)的益处。在一维偏微分方程基准测试上的消融实验表明,频率分解在频谱复杂问题上最为有效,可将误差降低高达59.2%。
本文提出ClaimGAT,一种Graph Attention Network,用于编码专利权利要求依赖关系以预测诉讼风险,在USPTO实用专利上取得了0.818的AUC-ROC。
本文形式化并实证测量了通过语言服务器协议进行语义检索是否为编码代理节省令牌,发现收益是条件性的且常常是负面的,建议采用自适应工具路由方法。
一项针对冲突预测中LLM自我反思的受控消融研究发现,类型化动作路由驱动性能提升,而诊断支架和分类词汇没有带来可衡量的价值,并在GPT-4o上进行了复现。
This paper shows that four seemingly minor architectural choices—normalization, GQA, pretraining context length, and sliding window attention—have a compoundingly negative effect on long context extensibility, dropping performance by up to 47% when combined. The authors release OlmPool, a set of 26 comparable 7B models, after 170,000 GPU hours of controlled ablations.
介绍了CT-HEG,一种用于ICU死亡预测的连续时间异质EHR图模式,通过消融研究表明双向连接和时间注意力边特征很重要;令人惊讶的是,在MIMIC-IV队列上,简化的同质图优于完整的异质模型。
This paper presents a controlled ablation study across Claude Code and Codex, 17 real tasks, and 288 runs, finding that context files like AGENTS.md/CLAUDE.md do not measurably improve correctness; agents fail on implementation skill, not missing repository knowledge.
一项针对4B模型分类任务的预注册消融实验表明,评估框架设计(规则位置、证据顺序、轮次结构)使准确率在60%到82%之间波动,说明糟糕的评估框架设计常常被误认为是模型能力不足。
本文比较了层级攻击性语言检测中的级联模型与联合多任务模型,发现级联架构以增加参数和推理延迟为代价获得了更高的准确率,并且类别不平衡处理策略应通过消融实验进行验证。
Loopie引入了循环混合专家Transformer,在相同计算预算下性能优于普通Transformer,在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)中无需工具即获得金牌水平表现。
本文研究了在交通预测中是否需要复杂的基于Transformer的注意力机制来提取全局空间信息,发现简单的全局聚合算子在更低计算复杂度下实现了相当的性能。
本文系统地分析了多个用于自然语言到SQL翻译的流水线扩展组件,包括中间表示、合成数据、预处理和重排器,使用SmBoP和RASAT架构,发现它们的交互比简单组合所有组件更重要。