hybrid-models

标签

Cards List
#hybrid-models

用于学习路由的混合量子-经典神经网络

arXiv cs.LG · 5天前 缓存

本文研究了用于车辆路径问题的混合量子-经典神经网络,发现编码器前馈替代可以将模型参数减少56.6%,同时在中小规模实例上保持接近基线性能。

0 人收藏 0 人点赞
#hybrid-models

用于具有学习路由的过程系统的保守混合图网络

arXiv cs.LG · 6天前 缓存

本文介绍了保守混合图网络(CHGN),这是一种用于建模动态过程系统的方法,无需重新训练即可外推到未见过的更大图,并改进工业应用中的故障预测。

0 人收藏 0 人点赞
#hybrid-models

技术性比较基准研究:用于可再生能源农场优化与预测的先进AI混合方法

arXiv cs.LG · 2026-08-28 缓存

这项比较基准研究评估了多种用于可再生能源农场优化与预测的AI方法,表明集成方法和混合方法在不同数据场景下表现出色。

0 人收藏 0 人点赞
#hybrid-models

混合量子预测模型学习几何的实证表征

arXiv cs.LG · 2026-08-21 缓存

本文实证性地表征了混合量子预测模型的学习几何,通过使用 Neural Tangent Kernel 动态和其他指标将其与经典基线进行比较,表明相似的泛化能力可以从不同的优化轨迹中涌现。

0 人收藏 0 人点赞
#hybrid-models

混合迭代生成模型的训练后量化

arXiv cs.LG · 2026-08-17 缓存

HyGenQ是一个针对混合迭代生成模型的训练后量化框架,解决了过度离群值和放大异常等挑战,实现了8位精度量化,同时保持生成质量。

0 人收藏 0 人点赞
#hybrid-models

混合线性注意力大语言模型中的大规模激活:注意力前尖峰与尖峰间平台期

Hugging Face Daily Papers · 2026-08-12 缓存

本文首次系统研究了混合线性注意力大语言模型中的大规模激活现象,揭示了由抵消时机控制的注意力前尖峰和尖峰间平台期,并展示了其形态如何在完全注意力极限下恢复。

0 人收藏 0 人点赞
#hybrid-models

用于混合可解释性的多阶段延迟树:若初试未成,再树一次

arXiv cs.LG · 2026-07-01 缓存

介绍了多阶段延迟树,这是一系列稀疏决策树,将困难样本延迟到后续树或黑盒模型,旨在在保持大部分预测可解释的同时达到集成模型的准确率。

0 人收藏 0 人点赞
#hybrid-models

在词元级别上比较Transformer和混合模型

Lobsters Hottest · 2026-06-27 缓存

本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。

0 人收藏 0 人点赞
#hybrid-models

@_albertgu:Transformer 更擅长复制,而 RNN 更擅长建模“承载意义的词——名词、动词和形容词……”

X AI KOLs Following · 2026-06-26 缓存

来自 Ai2 的一篇讨论比较了 transformer(Olmo 3)和混合模型(Olmo Hybrid),发现 transformer 在复制方面表现出色,而 RNN 在建模承载意义的词汇上更胜一筹,凸显了混合架构日益增长的可行性。

0 人收藏 0 人点赞
#hybrid-models

@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……

X AI KOLs Timeline · 2026-06-26 缓存

一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。

0 人收藏 0 人点赞
#hybrid-models

混合模型能更好地预测哪些令牌?

Hugging Face Blog · 2026-06-25 缓存

一项在令牌级别比较Olmo Hybrid和Olmo 3 Transformer的研究显示,混合模型能更好地预测有意义的令牌(如名词/动词),而Transformer模型则擅长从输入中复制令牌。

0 人收藏 0 人点赞
#hybrid-models

PE-MHL:用于复杂系统可扩展学习的物理编码模块化混合层

arXiv cs.LG · 2026-06-04

本文提出PE-MHL,一种物理编码模块化混合层框架,通过数据驱动子模型逐步优化基于物理的模型,提供理论收敛保证,并在控制基准测试中优于单一网络。

0 人收藏 0 人点赞
#hybrid-models

风功率预测中当前架构的系统评估

arXiv cs.LG · 2026-06-03 缓存

本文系统综述了区间风速预测的混合方法,结合深度学习、模态分解和统计方法以提高预测精度和可靠性。

0 人收藏 0 人点赞
#hybrid-models

互惠协同训练(RCT):通过强化学习耦合基于梯度与不可微模型

arXiv cs.CL · 2026-04-21 缓存

# 互惠协同训练(RCT):通过强化学习耦合基于梯度与不可微模型 来源:[https://arxiv.org/html/2604.16378](https://arxiv.org/html/2604.16378) Yunshuo Tian¹, Akayou Kitessa¹, Tanuja Chitnis², 和 Yijun Zhao¹ 1 纽约市福特汉姆大学计算机与信息科学系 2 马萨诸塞州波士顿市Mass General Brigham医院神经科 ###### 摘要 大型语言模型 \(LLMs\) 与经典机器学习方法提供互补...

0 人收藏 0 人点赞
#hybrid-models

Olmo Hybrid:从理论到实践再回到理论

arXiv cs.CL · 2026-04-20 缓存

本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈