transformer

标签

Cards List
#transformer

PolicyAttention:Softmax注意力实现闭环控制的策略镜像下降

arXiv cs.LG ↗ · 11小时前 缓存

本文提出PolicyAttention,一种使用因果Softmax注意力的方法来实现强化学习中闭环控制的策略镜像下降,在实验中实现了比现有适应方法更低的损失。

0 人收藏 0 人点赞
#transformer

T-RoPE:用于序列推荐的时间感知旋转位置嵌入

arXiv cs.AI ↗ · 昨天 缓存

本文介绍了T-RoPE,一种针对序列推荐系统的旋转位置嵌入的时间感知改进,展示了在基准测试上的显著性能提升以及在电子商务中的实际影响。

0 人收藏 0 人点赞
#transformer

Naive-N0.5-Flash - 309B-A15.5B

Reddit r/LocalLLaMA ↗ · 昨天 缓存

Naive-N0.5-Flash 是一款开放权重的309B混合专家模型,拥有155亿活跃参数,专为编程和AI研究优化,原生支持1M token上下文窗口并具备高速推理能力。

0 人收藏 0 人点赞
#transformer

YuE2:在前沿质量上统一符号与音频音乐生成

Hugging Face Daily Papers ↗ · 2天前 缓存

YuE2是一个统一的AI模型,用于符号和音频音乐生成,通过符号规划实现高质量结果,超越之前的基线,并与像Suno这样的专有系统竞争。

0 人收藏 0 人点赞
#transformer

@KirkDBorne: AI和ML论文解析(超大列表):https://github.com/dair-ai/ML-Papers-Explained… 由 @omarsar0 @dair_ai 整理 …

X AI KOLs Timeline ↗ · 4天前 缓存

一条推文分享了一个GitHub仓库,该仓库汇编了关键机器学习论文的解析,例如Transformer、BERT和GPT,用于教育目的。

0 人收藏 0 人点赞
#transformer

通过跨层共享神经专家提升Transformer的参数利用率

arXiv cs.LG ↗ · 2026-09-22 缓存

本文提出CS-MoE,一种创新的Transformer架构,通过跨层共享神经专家来提高参数利用率,仅激活55%的参数即可实现更低的困惑度。

0 人收藏 0 人点赞
#transformer

DPTM-DT: 双预训练Transformer多任务表示学习用于药物-靶点预测

arXiv cs.LG ↗ · 2026-09-22 缓存

论文介绍了DPTM-DT,这是一个用于多任务药物-靶点预测的双预训练Transformer框架,它结合了分子图嵌入、蛋白质语言模型嵌入和物理化学描述符,在基准数据集上实现了最先进的性能。

0 人收藏 0 人点赞
#transformer

用于文档敏感性分类的通道增强多智能体系统及其迭代咨询方法

arXiv cs.CL ↗ · 2026-09-22 缓存

本文介绍了一种名为CB-MAS的多智能体系统,用于文档敏感性分类。该系统通过迭代咨询和通道增强,解决了BERT等变压器模型中固定输入长度的局限性。

0 人收藏 0 人点赞
#transformer

@_michael_yu_: 我认为斯坦福的 CS336 是从零开始学习大语言模型(LLMs)的最佳材料之一。我刚完成学习(t…

X AI KOLs Timeline ↗ · 2026-09-22 缓存

Michael Yu 分享了他从斯坦福 CS336 课程中关于从零构建大语言模型的详细实现和学习心得,涵盖了分词器、Transformer、训练系统和对齐技术。

0 人收藏 0 人点赞
#transformer

Transformer模型图解

Hacker News Top ↗ · 2026-09-21 缓存

一个交互工具,视觉化解释Transformer模型的架构,使用GPT-2来说明关键组件,如嵌入、注意力机制和输出预测。

0 人收藏 0 人点赞
#transformer

16GB(在许多情况下是12GB)是大多数人合理拥有的最大显存

Reddit r/LocalLLaMA ↗ · 2026-09-21

文章讨论了由于经济限制,16GB显存对大多数用户来说是现实的高端限制,但最近的AI模型改进,如Qwen 27B quants,使得在这样的硬件上实现更多功能成为可能,并对未来的架构创新抱有希望。

0 人收藏 0 人点赞
#transformer

面向Transformer时间序列预测器的轻量级插件式门控

arXiv cs.LG ↗ · 2026-09-21 缓存

本文提出一种轻量级预编码器门控机制,用于基于Transformer的时间序列预测模型以调节协变量输入。实验表明,在多个数据集上与基线相比,性能具有竞争力。

0 人收藏 0 人点赞
#transformer

MOSAIC-SR: 基于Transformer的符号回归用于科学方程恢复

arXiv cs.LG ↗ · 2026-09-21 缓存

MOSAIC-SR引入了一种基于Transformer的符号回归方法,通过使用初始草图来改进方程恢复和科学数据集上的预测准确性。

0 人收藏 0 人点赞
#transformer

从压力到情感:基于多模态深度学习的可穿戴传感器模态生理情绪识别

arXiv cs.LG ↗ · 2026-09-21 缓存

一项使用多模态可穿戴数据集进行生理情绪识别的时序深度学习架构比较研究,评估了LSTM、TCN和Transformer模型在不同传感配置下的表现。

0 人收藏 0 人点赞
#transformer

Reviser:通过自回归光标动作实现可修订的文本生成

arXiv cs.CL ↗ · 2026-09-21 缓存

Reviser是一种新颖的仅解码器Transformer模型,通过自回归光标动作实现可修订的文本生成,与基线模型相比,在保持有竞争力性能的同时,降低了推理计算成本。

0 人收藏 0 人点赞
#transformer

从零开始的世界模型 2:模型训练与梦境生成 [P]

Reddit r/MachineLearning ↗ · 2026-09-19 缓存

本文详细介绍了使用 transformer 为 Super Mario Land 构建一个世界模型,通过标记化输入预测下一个游戏帧,并展示了自回归“梦境生成”来生成未来帧。

0 人收藏 0 人点赞
#transformer

@antiAIvo:学习 Transformer 时,最难处理的是多维矩阵操作,人类大脑只能在三维中建模……

X AI KOLs Timeline ↗ · 2026-09-19 缓存

本文介绍了一个针对 Transformer 中注意力机制的可视化工具,允许用户自定义输入矩阵,并查看注意力分数的逐步计算过程。这是一个初始版本,计划根据用户反馈进行未来更新。

0 人收藏 0 人点赞
#transformer

Neural Spectral Capacity: 从网络规范直接测量和设计架构

Hugging Face Daily Papers ↗ · 2026-09-19 缓存

本文介绍了Neural Spectral Capacity (NSC),一种基于奇异值谱的无需训练的指标,用于评估和优化神经网络架构,并提出了动态规划方法以在约束下进行最优设计。

0 人收藏 0 人点赞
#transformer

@Sumanth_077: 从零开始训练你自己的LLM!一个逐步指导你构建和训练transformer模型的仓库…

X AI KOLs Timeline ↗ · 2026-09-18 缓存

一个逐步指导用户使用PyTorch从零构建和训练transformer模型的仓库,全面覆盖数据处理、训练及后训练技术如SFT和RLHF。

0 人收藏 0 人点赞
#transformer

YNU-HPCC 在 SemEval-2025 Task 11:使用多预测头弥合基于文本的情感鸿沟

arXiv cs.CL ↗ · 2026-09-18 缓存

本文介绍了YNU-HPCC团队在SemEval-2025 Task 11中针对基于文本的情感识别任务的方法,使用了一个带有增强输出头的RoBERTa模型,并通过英文翻译数据集获得了0.44的排名分数。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈