transformers

标签

Cards List
#transformers

Nemotron 3 说话人识别的流式处理

Reddit r/LocalLLaMA ↗ · 昨天

文章描述了用户亲身体验 Nemotron 3 Diarization 模型的过程,重点介绍了其流式处理能力,以及将其整合到带有机器人的语音转语音设置中。

0 人收藏 0 人点赞
#transformers

@Zefan_Cai: 在点击确认前,找出错误的目标。试试 Open-Jev-27B-v1.1 演示:点击两个示例之间,看看模型如何选择操作。

X AI KOLs Following ↗ · 昨天 缓存

Open-Jev-27B-v1.1 是一个开源 AI 模型,配备 LoRA 适配器,在 JevBench 上达到 85.28% 的准确率,并具有各种任务的交互式演示。

0 人收藏 0 人点赞
#transformers

Hinton 与 LeCun 之争再现:近期推理模型是否证明了 LeCun 一直以来对自回归 LLM 的观点是正确的?

Reddit r/singularity ↗ · 2天前

AI 先驱 Geoffrey Hinton 与 Yann LeCun 之间关于自回归 LLM 效能的争论再次浮出水面,近期推理模型的进展重新引发了仅靠 Transformer 是否足以实现类人推理的讨论。

0 人收藏 0 人点赞
#transformers

@julien_c:transformers 与 @ggml_org 合作

X AI KOLs Following ↗ · 2天前 缓存

Transformers 与 ggml_org 合作,将 GGML 内核集成到 transformers 库中,使 GGUF 文件加载的性能水平与 llama.cpp 相当。

0 人收藏 0 人点赞
#transformers

@ggerganov: 直接使用transformers运行GGUF模型。这项工作将ggml的Metal内核引入transformers生态系统,提升兼容性和性能。

X AI KOLs Timeline ↗ · 2天前 缓存

这项工作将ggml的Metal内核集成到transformers库中,使GGUF模型能够直接运行,提升兼容性和性能,实现Mac上的快速本地推理。

0 人收藏 0 人点赞
#transformers

基于角色感知 Morgan Fingerprints 的反应产率预测

arXiv cs.LG ↗ · 2天前 缓存

本文提出 MFP,一种使用角色感知 Morgan fingerprints 预测化学反应产率的方法,与现有方法如 YieldBERT 和 GNAN 相比,实现了高准确度和更快的训练。

0 人收藏 0 人点赞
#transformers

从潜在生物标志物到临床规则:嵌入指导的规则挖掘与基于归因的翻译用于可解释表格学习

arXiv cs.LG ↗ · 2天前 缓存

本文提出一种流程,利用Transformer和嵌入技术从临床表格数据中提取可解释的决策规则,将潜在生物标志物映射回可测量的特征,从而提升临床决策支持效果。

0 人收藏 0 人点赞
#transformers

MechaTerp-TRACE:一种用于语言模型组件消融分析的新方法

arXiv cs.CL ↗ · 2天前 缓存

该论文介绍了MechaTerp-TRACE,一种用于语言模型组件消融分析的方法,发现实体知识主要来源于通用生成机制,而非局部组件。

0 人收藏 0 人点赞
#transformers

Transformer 中的世界建模

arXiv cs.AI ↗ · 3天前 缓存

本文证明了 Transformer 可以具备可靠的内部世界模型,通过机制性分析表明其故障源于特征干扰而非不连贯的映射,并提出了“可供性打包”方法以提升性能。

0 人收藏 0 人点赞
#transformers

量子模型是否像LLMs一样扩展?

arXiv cs.LG ↗ · 3天前 缓存

本文研究了在来自Rydberg atom arrays的量子测量数据上训练的transformers是否表现出类似于大型语言模型的神经缩放定律,发现缩放行为取决于数据的统计结构,尤其是在临界点附近。

0 人收藏 0 人点赞
#transformers

不规则现象非一概而论:因果隔离日语形态屈折中的罕见故障模式

arXiv cs.CL ↗ · 3天前 缓存

本文诊断了日语过去时动词屈折的神经形态生成中的系统性错误,聚焦于一个导致不成比例错误的罕见不规则子类型。消融实验表明,移除该子类型比移除所有不规则动词更能提高准确率,强调了细粒度子类分析的重要性。

0 人收藏 0 人点赞
#transformers

一个基于Qwen3.5 4B微调的Jev风格模型

Reddit r/LocalLLaMA ↗ · 4天前

作者使用LoRA对Qwen3.5 4B进行了微调,结合公开数据和合成数据创建了一个Jev风格模型,实现了性能提升,并开源了模型和数据集。

0 人收藏 0 人点赞
#transformers

@NFT_Chen: 太棒了!立即通过本地化决策引擎将任何LLM转换为Jev模型!LLM2Jev带来Jev的统一Ch…

X AI KOLs Timeline ↗ · 4天前 缓存

LLM2Jev是一个开源工具,它将本地HuggingFace模型适配为使用Choice、Score和Noul框架执行结构化决策,提供仅预填充推理,并与Transformers和SGLang集成。

0 人收藏 0 人点赞
#transformers

@shao__meng: https://x.com/shao__meng/status/2101562189945409913

X AI KOLs Timeline ↗ · 4天前 缓存

本文回顾了 Manus AI 团队一年前关于上下文工程实践的博客文章,总结了构建 AI Agent 时的六项关键经验,包括上下文管理、记忆恢复和错误处理等。

0 人收藏 0 人点赞
#transformers

@yibie: https://x.com/yibie/status/2101491585741394047

X AI KOLs Timeline ↗ · 4天前 缓存

本文详细解释了MoE(混合专家)推理工程,纠正了关于激活参数与部署成本的误解,并深入探讨了路由器选择、运行时分组、GPU执行、内存管理和专家并行等技术细节。

0 人收藏 0 人点赞
#transformers

@maximelabonne: BERT 在约2020年变得如此火爆,以至于 @huggingface 在其文档中专门设置了 "BERTology" 页面。满满的怀旧感 …

X AI KOLs Timeline ↗ · 5天前 缓存

对BERT在2020年重要影响的怀旧反思,Hugging Face将其记录为 'BERTology',并引发了对大语言模型构成的讨论。

0 人收藏 0 人点赞
#transformers

@XAMTO_AI:长PDF被切割成单页然后重新拼接,其中跨页表格和阅读顺序最容易……

X AI KOLs Timeline ↗ · 5天前 缓存

百度的开源Unlimited-OCR模型同时处理多个PDF页面,优于DeepSeek-OCR等基线模型,并支持本地执行与社区集成。

0 人收藏 0 人点赞
#transformers

当前系统泛化任务遗漏了什么?一个以推理为中心的分析

arXiv cs.AI ↗ · 6天前 缓存

本文介绍了TranSGrid,一个集成演绎、归纳和溯因推理来评估AI中系统泛化的测试平台。使用Transformer的实验表明,当前的任务忽略了基本的推理方面,导致在所提出的测试平台上出现性能差距。

0 人收藏 0 人点赞
#transformers

超越情节AI:面向生物启发持续认知的Cognitive Field Networks

arXiv cs.AI ↗ · 2026-09-16 缓存

本文提出Cognitive Field Networks (CFNs),一种用于连续认知动力学的循环Transformer架构,实现了无需显式记忆系统的持续、历史依赖认知,灵感来源于生物启发理论。

0 人收藏 0 人点赞
#transformers

关于门控的重要性:State Space Models中的记忆与上下文学习

arXiv cs.LG ↗ · 2026-09-16 缓存

本文研究了门控机制在State Space Models中的作用,表明它们促进记忆而非上下文学习,但能提高对长序列的泛化能力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈