标签
Sergey Levine 推荐 AI 机器人初学者阅读 ACT 或 ALOHA 论文,强调低成本机器人装置和简单的 Transformer 模型如何能够完成复杂的灵巧任务。
本文提出一种跨平台公平性评估框架,用于审计心理健康自然语言处理中的Transformer模型,揭示了当模型应用于不同社交媒体平台时,存在显著的性能与校准问题。
本文介绍了一种AI增强的RF干扰抑制方法,该方法使用带有有限标量量化分词器的Transformer模型,以提升性能并最小化延迟,并通过数字信号场景中的音频指标进行验证。
本文探讨了在使用电子废弃GPU搭建的家庭服务器上优化AI语言模型性能,并解释了Transformer模型和多GPU技术。
ATHENA是一个知识引导的代理神经架构搜索框架,通过跨医院重用架构知识来自动化Transformer基础的电子健康记录建模,以减少人工调优。
本文研究《Game of Hidden Rules》中的人工智能学习和概念迁移,重点关注基于Transformer的A2C框架的强化学习、规则难度分析、迁移学习和泛化。
本批判性叙述综述探讨了大语言模型和基于transformer的系统如何重塑Hadith计算科学,突出了数据资源和分段任务方面的进展,同时指出了叙述者验证和可重复性方面的差距,并提出了方法论强化的研究议程。
对BART、BERT和RoBERTa在文本摘要中的比较研究,探讨它们的架构以及在抽取式和生成式摘要任务中的适用性。
本文介绍了Strategic 16K,一个用于文档敏感性分类的泄露控制数据集,并对经典与基于Transformer的模型进行了基准测试,其中BERT在解决标签泄露问题的同时取得了最佳性能。
本文质疑了将动态参数化与动态推断混为一谈的做法,引入了冻结控制器审计(Frozen-Controller Auditing),以证明输入相关的系数并不意味着计算节省。在Transformer上的实验表明,尽管没有条件执行,静态逐层配置文件仍能保持近乎完整的性能。
本文针对从红外光谱中无约束分子结构解析的问题,提出了对编码器-解码器Transformer的改进,采用混合专家(MoE)解码器和对比对齐损失函数,在Top-K准确率上提升了超过10个百分点。
本文研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何通过可解释性技术,在下一个词元预测任务中编码因果关系与对立关系的话语关系。
精心整理的资源列表,用于掌握LLM缓存管理,包括关于KV缓存、前缀缓存及相关技术的解释、教程和研究论文。
Loopie 是一种新型循环 Transformer 模型,通过新颖的后训练流程,在 2025 年国际数学奥林匹克竞赛(IMO)和国际物理奥林匹克竞赛(IPhO)中无需外部工具即获得金牌表现。在相同计算预算下,它优于普通 Transformer。
DataStates-LLM提出了一种可扩展的检查点架构,利用可组合的状态提供程序,相比于现有解决方案,吞吐量提升高达4倍,训练时间减少2.2倍。
本文系统性地实证研究了针对《古兰经》自动语音识别(ASR)的预训练Transformer模型(Wav2Vec2.0、HuBERT、XLS-R)微调,在EveryAyah子集上实现了0.08的词错误率(WER),并将训练时间从140小时减少到40小时,其中Wav2Vec2-XLSR-53提供了最佳表示。
Google研究人员发表了一篇论文,总结了从TPU v2到Ironwood的TPU超级计算机的演进,详细介绍了架构稳定性、规模、弹性、能效以及八年间3600倍的性能提升。
本文批判性地评述了大型语言模型时代的圣训计算科学,重点分析了该领域的进展、方法论上的不足,并提出一项研究议程以加强伊斯兰学术的证据基础设施。
作者询问如何分析神经网络中探针的相对“强度”,讨论了词汇量有限和模型容量等挑战,并以Google Gemini为例说明了失败情况。
本文介绍了一种双重诊断框架,用于追踪LLM中代码推理的内部生命周期,揭示了模型首先‘酝酿’答案,然后分化为四种解析结果,且跨架构的酝酿稳定性一致,但解析成功率不同。