标签
本文提出PolicyAttention,一种使用因果Softmax注意力的方法来实现强化学习中闭环控制的策略镜像下降,在实验中实现了比现有适应方法更低的损失。
本文介绍了T-RoPE,一种针对序列推荐系统的旋转位置嵌入的时间感知改进,展示了在基准测试上的显著性能提升以及在电子商务中的实际影响。
Naive-N0.5-Flash 是一款开放权重的309B混合专家模型,拥有155亿活跃参数,专为编程和AI研究优化,原生支持1M token上下文窗口并具备高速推理能力。
YuE2是一个统一的AI模型,用于符号和音频音乐生成,通过符号规划实现高质量结果,超越之前的基线,并与像Suno这样的专有系统竞争。
一条推文分享了一个GitHub仓库,该仓库汇编了关键机器学习论文的解析,例如Transformer、BERT和GPT,用于教育目的。
本文提出CS-MoE,一种创新的Transformer架构,通过跨层共享神经专家来提高参数利用率,仅激活55%的参数即可实现更低的困惑度。
论文介绍了DPTM-DT,这是一个用于多任务药物-靶点预测的双预训练Transformer框架,它结合了分子图嵌入、蛋白质语言模型嵌入和物理化学描述符,在基准数据集上实现了最先进的性能。
本文介绍了一种名为CB-MAS的多智能体系统,用于文档敏感性分类。该系统通过迭代咨询和通道增强,解决了BERT等变压器模型中固定输入长度的局限性。
Michael Yu 分享了他从斯坦福 CS336 课程中关于从零构建大语言模型的详细实现和学习心得,涵盖了分词器、Transformer、训练系统和对齐技术。
一个交互工具,视觉化解释Transformer模型的架构,使用GPT-2来说明关键组件,如嵌入、注意力机制和输出预测。
文章讨论了由于经济限制,16GB显存对大多数用户来说是现实的高端限制,但最近的AI模型改进,如Qwen 27B quants,使得在这样的硬件上实现更多功能成为可能,并对未来的架构创新抱有希望。
本文提出一种轻量级预编码器门控机制,用于基于Transformer的时间序列预测模型以调节协变量输入。实验表明,在多个数据集上与基线相比,性能具有竞争力。
MOSAIC-SR引入了一种基于Transformer的符号回归方法,通过使用初始草图来改进方程恢复和科学数据集上的预测准确性。
一项使用多模态可穿戴数据集进行生理情绪识别的时序深度学习架构比较研究,评估了LSTM、TCN和Transformer模型在不同传感配置下的表现。
Reviser是一种新颖的仅解码器Transformer模型,通过自回归光标动作实现可修订的文本生成,与基线模型相比,在保持有竞争力性能的同时,降低了推理计算成本。
本文详细介绍了使用 transformer 为 Super Mario Land 构建一个世界模型,通过标记化输入预测下一个游戏帧,并展示了自回归“梦境生成”来生成未来帧。
本文介绍了一个针对 Transformer 中注意力机制的可视化工具,允许用户自定义输入矩阵,并查看注意力分数的逐步计算过程。这是一个初始版本,计划根据用户反馈进行未来更新。
本文介绍了Neural Spectral Capacity (NSC),一种基于奇异值谱的无需训练的指标,用于评估和优化神经网络架构,并提出了动态规划方法以在约束下进行最优设计。
一个逐步指导用户使用PyTorch从零构建和训练transformer模型的仓库,全面覆盖数据处理、训练及后训练技术如SFT和RLHF。
本文介绍了YNU-HPCC团队在SemEval-2025 Task 11中针对基于文本的情感识别任务的方法,使用了一个带有增强输出头的RoBERTa模型,并通过英文翻译数据集获得了0.44的排名分数。