ablation-study

标签

Cards List
#ablation-study

算子包、提案器效能与办公室规模可验证搜索中的构造族平台期

arXiv cs.CL ↗ · 6天前 缓存

本文在一个极简的FunSearch风格循环中引入算子包,以测试可验证搜索中数学构造问题提案器的各个组成部分,研究发现组合能够缩小差距,而排斥机制则增强了多样性。

0 人收藏 0 人点赞
#ablation-study

小型MLA-SSM混合语言模型的探索性消融

arXiv cs.CL ↗ · 6天前 缓存

本文展示了对TALH的探索性消融研究,TALH是一种结合MLA和SSM的混合语言模型,表明在测试设置中,SSM的集成对验证性能的影响大于MLA,并提供了关于消费级硬件上内存使用和计时的见解。

0 人收藏 0 人点赞
#ablation-study

MechaTerp-TRACE:一种用于语言模型组件消融分析的新方法

arXiv cs.CL ↗ · 2026-09-22 缓存

该论文介绍了MechaTerp-TRACE,一种用于语言模型组件消融分析的方法,发现实体知识主要来源于通用生成机制,而非局部组件。

0 人收藏 0 人点赞
#ablation-study

基于历史数据的物理知识比在预测中强制施加物理约束更为重要

arXiv cs.AI ↗ · 2026-09-18 缓存

本文提出了一种物理信息循环神经网络(PIRNN),通过预测不可观测的物理变量来改进物理过程的时间序列预测,并以地下水位预测为例进行演示。

0 人收藏 0 人点赞
#ablation-study

可解码性非因果性:通过SAE分解区分探测器输出与行为驱动因素

arXiv cs.AI ↗ · 2026-09-17 缓存

本文证明,从语言模型激活中解码概念的线性探测器不一定能识别因果相关特征,并引入了使用稀疏自编码器的特征级诊断方法,以将探测器对齐与行为驱动因素分离。

0 人收藏 0 人点赞
#ablation-study

编码代理工具架设计的实证研究

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

本文实证研究了编码代理的工具架设计,评估了规划和上下文管理等组件,以提高软件工程任务的性能。

0 人收藏 0 人点赞
#ablation-study

代理搜索份额:用于LLM电子商务竞争决策的多代理AI系统

arXiv cs.AI ↗ · 2026-09-12 缓存

本文介绍了一种多代理AI系统,用于测量和诊断LLM电子商务中的竞争可见性,采用代理搜索份额指标,并通过消融研究验证了其可行性。

0 人收藏 0 人点赞
#ablation-study

来自提示层级上下文的侧级词错误率无显著变化:一项针对生产口语历史语料库的预注册消融研究

arXiv cs.CL ↗ · 2026-09-01 缓存

这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。

0 人收藏 0 人点赞
#ablation-study

频率分解何时有益于物理信息神经网络(PINNs)?一项初步消融研究

arXiv cs.LG ↗ · 2026-08-27 缓存

本研究通过提出一种双分支、频谱门控架构(DBSG-PINN),探讨了频率分解对物理信息神经网络(PINNs)的益处。在一维偏微分方程基准测试上的消融实验表明,频率分解在频谱复杂问题上最为有效,可将误差降低高达59.2%。

0 人收藏 0 人点赞
#ablation-study

使用图注意力网络建模权利要求依赖结构以预测专利诉讼

arXiv cs.CL ↗ · 2026-08-25 缓存

本文提出ClaimGAT,一种Graph Attention Network,用于编码专利权利要求依赖关系以预测诉讼风险,在USPTO实用专利上取得了0.818的AUC-ROC。

0 人收藏 0 人点赞
#ablation-study

语言服务器是否为编码代理节省令牌?一种测量方法论与初步研究

arXiv cs.CL ↗ · 2026-08-17 缓存

本文形式化并实证测量了通过语言服务器协议进行语义检索是否为编码代理节省令牌,发现收益是条件性的且常常是负面的,建议采用自适应工具路由方法。

0 人收藏 0 人点赞
#ablation-study

什么驱动LLM自我反思?武装冲突预测中不确定性路由的受控消融

arXiv cs.CL ↗ · 2026-08-14 缓存

一项针对冲突预测中LLM自我反思的受控消融研究发现,类型化动作路由驱动性能提升,而诊断支架和分类词汇没有带来可衡量的价值,并在GPT-4o上进行了复现。

0 人收藏 0 人点赞
#ablation-study

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

arXiv cs.CL ↗ · 2026-08-12 缓存

This paper shows that four seemingly minor architectural choices—normalization, GQA, pretraining context length, and sliding window attention—have a compoundingly negative effect on long context extensibility, dropping performance by up to 47% when combined. The authors release OlmPool, a set of 26 comparable 7B models, after 170,000 GPU hours of controlled ablations.

0 人收藏 0 人点赞
#ablation-study

CT-HEG:一种用于ICU院内死亡预测的双向、时间戳属性事件图——一项架构消融研究

arXiv cs.LG ↗ · 2026-08-05 缓存

介绍了CT-HEG,一种用于ICU死亡预测的连续时间异质EHR图模式,通过消融研究表明双向连接和时间注意力边特征很重要;令人惊讶的是,在MIMIC-IV队列上,简化的同质图优于完整的异质模型。

0 人收藏 0 人点赞
#ablation-study

@dair_ai: If you maintain an AGENTS.md or a CLAUDE.md, this is worth a read. (bookmark it) 288 gold-test evaluated runs across Cl…

X AI KOLs Following ↗ · 2026-08-01 缓存

This paper presents a controlled ablation study across Claude Code and Codex, 17 real tasks, and 288 runs, finding that context files like AGENTS.md/CLAUDE.md do not measurably improve correctness; agents fail on implementation skill, not missing repository knowledge.

0 人收藏 0 人点赞
#ablation-study

4B模型分类任务上60%-82%的准确率波动:唯一变量是评估框架设计

Reddit r/LocalLLaMA ↗ · 2026-07-31

一项针对4B模型分类任务的预注册消融实验表明,评估框架设计(规则位置、证据顺序、轮次结构)使准确率在60%到82%之间波动,说明糟糕的评估框架设计常常被误认为是模型能力不足。

0 人收藏 0 人点赞
#ablation-study

层级攻击性语言检测中的级联模型与联合模型对比

arXiv cs.CL ↗ · 2026-07-21 缓存

本文比较了层级攻击性语言检测中的级联模型与联合多任务模型,发现级联架构以增加参数和推理延迟为代价获得了更高的准确率,并且类别不平衡处理策略应通过消融实验进行验证。

0 人收藏 0 人点赞
#ablation-study

循环Loopies!

Hugging Face Daily Papers ↗ · 2026-07-17 缓存

Loopie引入了循环混合专家Transformer,在相同计算预算下性能优于普通Transformer,在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)中无需工具即获得金牌水平表现。

0 人收藏 0 人点赞
#ablation-study

我们真的需要Transformer来提取交通预测中的全局空间信息吗?

arXiv cs.AI ↗ · 2026-07-15 缓存

本文研究了在交通预测中是否需要复杂的基于Transformer的注意力机制来提取全局空间信息,发现简单的全局聚合算子在更低计算复杂度下实现了相当的性能。

0 人收藏 0 人点赞
#ablation-study

自然语言到SQL翻译的螺母与螺栓:模型流水线优化方法及其交互的系统性分析

arXiv cs.CL ↗ · 2026-07-14 缓存

本文系统地分析了多个用于自然语言到SQL翻译的流水线扩展组件,包括中间表示、合成数据、预处理和重排器,使用SmBoP和RASAT架构,发现它们的交互比简单组合所有组件更重要。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈