transformer-models

标签

Cards List
#transformer-models

@ryanlpeterman:Sergey Levine(@svlevine)为想进入该领域的人推荐的顶级AI机器人论文:"The orig…

X AI KOLs Following · 16小时前 缓存

Sergey Levine 推荐 AI 机器人初学者阅读 ACT 或 ALOHA 论文,强调低成本机器人装置和简单的 Transformer 模型如何能够完成复杂的灵巧任务。

0 人收藏 0 人点赞
#transformer-models

心理健康自然语言处理中的跨平台泛化失败:社交媒体Transformer模型的五维公平性审计

arXiv cs.CL · 2天前 缓存

本文提出一种跨平台公平性评估框架,用于审计心理健康自然语言处理中的Transformer模型,揭示了当模型应用于不同社交媒体平台时,存在显著的性能与校准问题。

0 人收藏 0 人点赞
#transformer-models

清除障碍:AI增强的RF干扰抑制

arXiv cs.LG · 3天前

本文介绍了一种AI增强的RF干扰抑制方法,该方法使用带有有限标量量化分词器的Transformer模型,以提升性能并最小化延迟,并通过数字信号场景中的音频指标进行验证。

0 人收藏 0 人点赞
#transformer-models

AI在家第二部分:多GPU技术

Lobsters Hottest · 4天前 缓存

本文探讨了在使用电子废弃GPU搭建的家庭服务器上优化AI语言模型性能,并解释了Transformer模型和多GPU技术。

0 人收藏 0 人点赞
#transformer-models

ATHENA:知识引导的代理神经架构搜索,用于基于AutoFormer的电子健康记录建模

arXiv cs.AI · 5天前 缓存

ATHENA是一个知识引导的代理神经架构搜索框架,通过跨医院重用架构知识来自动化Transformer基础的电子健康记录建模,以减少人工调优。

0 人收藏 0 人点赞
#transformer-models

《Game of Hidden Rules》中的人工智能学习与概念迁移

arXiv cs.AI · 5天前 缓存

本文研究《Game of Hidden Rules》中的人工智能学习和概念迁移,重点关注基于Transformer的A2C框架的强化学习、规则难度分析、迁移学习和泛化。

0 人收藏 0 人点赞
#transformer-models

大语言模型时代的Hadith计算科学:批判性叙述综述

arXiv cs.CL · 6天前 缓存

本批判性叙述综述探讨了大语言模型和基于transformer的系统如何重塑Hadith计算科学,突出了数据资源和分段任务方面的进展,同时指出了叙述者验证和可重复性方面的差距,并提出了方法论强化的研究议程。

0 人收藏 0 人点赞
#transformer-models

用于文本摘要的Transformer模型:BART、BERT与RoBERTa的比较研究

arXiv cs.CL · 2026-08-21 缓存

对BART、BERT和RoBERTa在文本摘要中的比较研究,探讨它们的架构以及在抽取式和生成式摘要任务中的适用性。

0 人收藏 0 人点赞
#transformer-models

评估经典与Transformer模型在文档敏感性分类中的性能

arXiv cs.LG · 2026-08-19 缓存

本文介绍了Strategic 16K,一个用于文档敏感性分类的泄露控制数据集,并对经典与基于Transformer的模型进行了基准测试,其中BERT在解决标签泄露问题的同时取得了最佳性能。

0 人收藏 0 人点赞
#transformer-models

动态参数化并非动态推断

arXiv cs.LG · 2026-07-30 缓存

本文质疑了将动态参数化与动态推断混为一谈的做法,引入了冻结控制器审计(Frozen-Controller Auditing),以证明输入相关的系数并不意味着计算节省。在Transformer上的实验表明,尽管没有条件执行,静态逐层配置文件仍能保持近乎完整的性能。

0 人收藏 0 人点赞
#transformer-models

数据融合与对比对齐用于无约束红外分子结构解析

arXiv cs.LG · 2026-07-30 缓存

本文针对从红外光谱中无约束分子结构解析的问题,提出了对编码器-解码器Transformer的改进,采用混合专家(MoE)解码器和对比对齐损失函数,在Top-K准确率上提升了超过10个百分点。

0 人收藏 0 人点赞
#transformer-models

为什么?解读模型对因果关系与对立关系的编码

arXiv cs.CL · 2026-07-22 缓存

本文研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何通过可解释性技术,在下一个词元预测任务中编码因果关系与对立关系的话语关系。

0 人收藏 0 人点赞
#transformer-models

@Alacritic_Super: 想要掌握LLM缓存管理?从这些资源开始。KV缓存:https://huggingface.co/docs/transformers/mai…

X AI KOLs Timeline · 2026-07-21 缓存

精心整理的资源列表,用于掌握LLM缓存管理,包括关于KV缓存、前缀缓存及相关技术的解释、教程和研究论文。

0 人收藏 0 人点赞
#transformer-models

循环 Loopie!

arXiv cs.CL · 2026-07-20 缓存

Loopie 是一种新型循环 Transformer 模型,通过新颖的后训练流程,在 2025 年国际数学奥林匹克竞赛(IMO)和国际物理奥林匹克竞赛(IPhO)中无需外部工具即获得金牌表现。在相同计算预算下,它优于普通 Transformer。

0 人收藏 0 人点赞
#transformer-models

DataStates-LLM:使用可组合状态提供程序实现Transformer模型的可扩展检查点

arXiv cs.AI · 2026-06-29 缓存

DataStates-LLM提出了一种可扩展的检查点架构,利用可组合的状态提供程序,相比于现有解决方案,吞吐量提升高达4倍,训练时间减少2.2倍。

0 人收藏 0 人点赞
#transformer-models

针对《古兰经》语音识别的预训练Transformer模型比较研究:语音表示、标签格式与数据集构成

arXiv cs.AI · 2026-06-20 缓存

本文系统性地实证研究了针对《古兰经》自动语音识别(ASR)的预训练Transformer模型(Wav2Vec2.0、HuBERT、XLS-R)微调,在EveryAyah子集上实现了0.08的词错误率(WER),并将训练时间从140小时减少到40小时,其中Wav2Vec2-XLSR-53提供了最佳表示。

0 人收藏 0 人点赞
#transformer-models

@JeffDean:我的@Google同事@NormJouppi、Sridhar Lakshmanamurthy、Cliff Young和David Patterson最近撰写了一篇论文,该论文…

X AI KOLs Following · 2026-06-18 缓存

Google研究人员发表了一篇论文,总结了从TPU v2到Ironwood的TPU超级计算机的演进,详细介绍了架构稳定性、规模、弹性、能效以及八年间3600倍的性能提升。

0 人收藏 0 人点赞
#transformer-models

大型语言模型时代的圣训计算科学:批判性叙事综述

Hugging Face Daily Papers · 2026-06-18 缓存

本文批判性地评述了大型语言模型时代的圣训计算科学,重点分析了该领域的进展、方法论上的不足,并提出一项研究议程以加强伊斯兰学术的证据基础设施。

0 人收藏 0 人点赞
#transformer-models

如何分析探针的相对“强度”?[R]

Reddit r/MachineLearning · 2026-06-17

作者询问如何分析神经网络中探针的相对“强度”,讨论了词汇量有限和模型容量等挑战,并以Google Gemini为例说明了失败情况。

0 人收藏 0 人点赞
#transformer-models

从酝酿到解析:追踪LLM中代码推理的内部生命周期

arXiv cs.AI · 2026-06-17 缓存

本文介绍了一种双重诊断框架,用于追踪LLM中代码推理的内部生命周期,揭示了模型首先‘酝酿’答案,然后分化为四种解析结果,且跨架构的酝酿稳定性一致,但解析成功率不同。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈