transformer

标签

Cards List
#transformer

基于Forma的完整财务报表长期预测

arXiv cs.LG · 14小时前 缓存

本文介绍了ProForma-20Q,一个用于预测未来1至20个季度78个财务报表行项目的基准,以及Forma,一个基于Transformer的模型,它超越了通用方法,尤其是在长期预测中,并具有接近会计恒等式的一致性。

0 人收藏 0 人点赞
#transformer

LabelFusion-TS: Fusing Large Language Models, Transformer Encoders, and Financial Time Series for Monetary-Policy Stance Classification

arXiv cs.CL · 14小时前 缓存

This paper introduces LabelFusion-TS, which fuses a fine-tuned RoBERTa encoder, a prompted LLM, and time-series transformers over market data to classify Federal Reserve communication as hawkish, dovish, or neutral. The fused system achieves 70.2% weighted F1, outperforming a zero-shot LLM and showing early evidence that market time series help financial text classification.

0 人收藏 0 人点赞
#transformer

基于ODE的Transformer解码器用于迭代手语翻译

arXiv cs.CL · 14小时前 缓存

本文提出使用Runge-Kutta积分方法的基于ODE的Transformer解码器,以改进手语翻译的迭代细化过程,在不增加模型大小的情况下,取得了比IPSLT基线更好的BLEU分数。

0 人收藏 0 人点赞
#transformer

chessformer_lens 演示:消融国际象棋 transformer 的 128 个注意力头中的一个,导致模型不再能找到 Morphy 的后牺牲 [P]

Reddit r/MachineLearning · 18小时前

chessformer_lens 的一个演示表明,消融国际象棋 transformer 中的一个注意力头,会导致模型停止识别 Morphy 的后牺牲,这展示了特定能力集中在单个注意力头中。

0 人收藏 0 人点赞
#transformer

评估基于BERT的模型在问答任务中的可靠性

arXiv cs.CL · 昨天 缓存

本文评估了基于BERT的问答模型(RoBERTa、ALBERT、DistilBERT)在蒙特卡洛Dropout和输入改写条件下的可靠性,发现RoBERTa更为一致,并验证了MCD作为可靠性指标的有效性。

0 人收藏 0 人点赞
#transformer

先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架

arXiv cs.LG · 昨天 缓存

本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。

0 人收藏 0 人点赞
#transformer

CRHT:一种基于在线聚类采样的连续回归混合Transformer船舶轨迹预测方法

arXiv cs.LG · 昨天 缓存

本文提出了CRHT,一种利用AIS数据进行船舶轨迹预测的连续回归混合Transformer,采用在线K-means聚类采样策略和CNN-Transformer混合架构,以解决地理偏差问题并提高短期预测精度。

0 人收藏 0 人点赞
#transformer

From Prediction to Incrementality: Causal Optimization for Large-Scale Targeting and Recommendation

arXiv cs.LG · 昨天 缓存

This paper presents a decision-centric causal optimization framework for large-scale targeting and recommendation, combining a causal Transformer, Bayesian bandit layer, and dual-based linear programming. It reports a statistically significant +7.20% lift in LinkedIn Feed marketing traffic via online A/B testing.

0 人收藏 0 人点赞
#transformer

DoGMA:中心法则引导的肿瘤学多组学对齐与多任务学习基础模型

arXiv cs.LG · 2天前 缓存

DoGMA 是一种中心法则引导的泛癌多组学分析基础模型,采用 Transformer-MoE 架构,通过定向注意力对齐 DNA-RNA-蛋白质信息流,并利用掩码层次组学重构进行预训练。它在癌症表征学习、生存预测和转移预测任务中均表现出强劲性能。

0 人收藏 0 人点赞
#transformer

谱异常值揭示Transformer注意力中主导的学习结构

arXiv cs.LG · 2天前 缓存

本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。

0 人收藏 0 人点赞
#transformer

超越注意力:BiomeGPT风格微生物组Transformer中的有符号集成梯度归因

arXiv cs.LG · 3天前 缓存

本文提出在类似BiomeGPT的特征标记化Transformer中使用有符号、融合感知的集成梯度来进行预测归因,克服了CLS注意力权重的局限性,并揭示支持疾病与保护性微生物信号。

0 人收藏 0 人点赞
#transformer

潜在事实核查:通过激活工程检测错误信息

arXiv cs.LG · 3天前 缓存

本文介绍了一种基于激活工程的错误信息检测框架,将最后一个token的激活投影到LLM残差流中学习到的“虚假方向”上。研究在Gemma、Llama和Qwen模型上进行了事实核查基准评估,表明真实性在潜在空间中是线性可分的。

0 人收藏 0 人点赞
#transformer

bioMoR:面向高效基因组学习的生物引导混合递归框架

arXiv cs.AI · 3天前 缓存

本文介绍了 bioMoR,一种用于基因组学习的生物引导混合递归框架,它将结构化的生物学知识整合到递归 Transformer 架构中,在多个组学基准上提升了效率和准确性。

0 人收藏 0 人点赞
#transformer

@shikhargupta02: 我一直在学习潜在注意力(来自 DeepSeek)。它不是为每个 token 存储完整的 K 和 V 向量,而是……

X AI KOLs Timeline · 5天前 缓存

作者分享了他用 DeepSeek 的潜在注意力训练一个小模型的见解,观察到潜在空间的使用因层而异,以及一个可以将 KV 缓存减少 4 倍且损失不变的测试时技巧。

0 人收藏 0 人点赞
#transformer

MACRO: Markov Chain Routing of Transformer Layers

arXiv cs.CL · 6天前 缓存

MACRO is a framework that learns task-specific execution routes over frozen LLM layers using Markov chain-based routing, improving reasoning accuracy without modifying model weights. It outperforms prior routing approaches while reducing search time significantly.

0 人收藏 0 人点赞
#transformer

频谱混叠前置任务:旋转机械自监督故障诊断的新任务

arXiv cs.LG · 6天前 缓存

本文介绍了频谱混叠前置任务(SAP),一种面向旋转机械故障诊断的自监督学习方法。通过有意对振动信号进行欠采样,并训练Transformer重建原始频谱,SAP学习到具有判别性的频域表示,从而在有限标注数据下实现强大的分类性能。

0 人收藏 0 人点赞
#transformer

面向边缘计算流量智能的时空图Transformer

arXiv cs.LG · 2026-08-06 缓存

本文提出了一种用于边缘计算中流量预测的时空图Transformer框架,结合图神经网络捕捉空间相关性,以及Transformer自注意力捕捉长程时间依赖。在真实蜂窝数据上的实验表明,它优于基于循环图的基线模型,如GCN-LSTM和GCN-GRU。

0 人收藏 0 人点赞
#transformer

@seclink: 有几个显而易见的面试题是: 1. Transformer 能不能做大模型推理? 能做,那为啥不用,而是必须用 sglang 、 vllm ? - 其实本质上还是因为 Transformer 性能太拉垮 ,瓶颈在显存 (KV cache )…

X AI KOLs Timeline · 2026-08-05 缓存

讨论Transformer做大规模推理的瓶颈,并梳理2023到2026年间大模型推理优化技术的演进,包括KV cache量化、推测解码、架构创新和软硬件协同设计。

0 人收藏 0 人点赞
#transformer

在8美元的ESP32-S3上训练的SLM

Hacker News Top · 2026-08-05 缓存

Qapla'是一个项目,演示了在8美元的ESP32-S3微控制器上从头训练一个小型Transformer语言模型,表明无需GPU或数据中心即可实现设备端训练。

0 人收藏 0 人点赞
#transformer

扩展自回归Transformer以用于单细胞生成

arXiv cs.LG · 2026-08-05 缓存

本文研究了一项自监督任务,即使用带有量化VAE分词器的自回归Transformer生成单细胞基因表达向量。文中报告了单细胞基础模型的缩放定律和计算最优前沿,并讨论了针对扰动预测进行微调的潜力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈