标签
本文研究了用于车辆路径问题的混合量子-经典神经网络,发现编码器前馈替代可以将模型参数减少56.6%,同时在中小规模实例上保持接近基线性能。
本文介绍了保守混合图网络(CHGN),这是一种用于建模动态过程系统的方法,无需重新训练即可外推到未见过的更大图,并改进工业应用中的故障预测。
这项比较基准研究评估了多种用于可再生能源农场优化与预测的AI方法,表明集成方法和混合方法在不同数据场景下表现出色。
本文实证性地表征了混合量子预测模型的学习几何,通过使用 Neural Tangent Kernel 动态和其他指标将其与经典基线进行比较,表明相似的泛化能力可以从不同的优化轨迹中涌现。
HyGenQ是一个针对混合迭代生成模型的训练后量化框架,解决了过度离群值和放大异常等挑战,实现了8位精度量化,同时保持生成质量。
本文首次系统研究了混合线性注意力大语言模型中的大规模激活现象,揭示了由抵消时机控制的注意力前尖峰和尖峰间平台期,并展示了其形态如何在完全注意力极限下恢复。
介绍了多阶段延迟树,这是一系列稀疏决策树,将困难样本延迟到后续树或黑盒模型,旨在在保持大部分预测可解释的同时达到集成模型的准确率。
本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。
来自 Ai2 的一篇讨论比较了 transformer(Olmo 3)和混合模型(Olmo Hybrid),发现 transformer 在复制方面表现出色,而 RNN 在建模承载意义的词汇上更胜一筹,凸显了混合架构日益增长的可行性。
一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。
一项在令牌级别比较Olmo Hybrid和Olmo 3 Transformer的研究显示,混合模型能更好地预测有意义的令牌(如名词/动词),而Transformer模型则擅长从输入中复制令牌。
本文提出PE-MHL,一种物理编码模块化混合层框架,通过数据驱动子模型逐步优化基于物理的模型,提供理论收敛保证,并在控制基准测试中优于单一网络。
# 互惠协同训练(RCT):通过强化学习耦合基于梯度与不可微模型 来源:[https://arxiv.org/html/2604.16378](https://arxiv.org/html/2604.16378) Yunshuo Tian¹, Akayou Kitessa¹, Tanuja Chitnis², 和 Yijun Zhao¹ 1 纽约市福特汉姆大学计算机与信息科学系 2 马萨诸塞州波士顿市Mass General Brigham医院神经科 ###### 摘要 大型语言模型 \(LLMs\) 与经典机器学习方法提供互补...
本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。