标签
文章描述了用户亲身体验 Nemotron 3 Diarization 模型的过程,重点介绍了其流式处理能力,以及将其整合到带有机器人的语音转语音设置中。
Open-Jev-27B-v1.1 是一个开源 AI 模型,配备 LoRA 适配器,在 JevBench 上达到 85.28% 的准确率,并具有各种任务的交互式演示。
AI 先驱 Geoffrey Hinton 与 Yann LeCun 之间关于自回归 LLM 效能的争论再次浮出水面,近期推理模型的进展重新引发了仅靠 Transformer 是否足以实现类人推理的讨论。
Transformers 与 ggml_org 合作,将 GGML 内核集成到 transformers 库中,使 GGUF 文件加载的性能水平与 llama.cpp 相当。
这项工作将ggml的Metal内核集成到transformers库中,使GGUF模型能够直接运行,提升兼容性和性能,实现Mac上的快速本地推理。
本文提出 MFP,一种使用角色感知 Morgan fingerprints 预测化学反应产率的方法,与现有方法如 YieldBERT 和 GNAN 相比,实现了高准确度和更快的训练。
本文提出一种流程,利用Transformer和嵌入技术从临床表格数据中提取可解释的决策规则,将潜在生物标志物映射回可测量的特征,从而提升临床决策支持效果。
该论文介绍了MechaTerp-TRACE,一种用于语言模型组件消融分析的方法,发现实体知识主要来源于通用生成机制,而非局部组件。
本文证明了 Transformer 可以具备可靠的内部世界模型,通过机制性分析表明其故障源于特征干扰而非不连贯的映射,并提出了“可供性打包”方法以提升性能。
本文研究了在来自Rydberg atom arrays的量子测量数据上训练的transformers是否表现出类似于大型语言模型的神经缩放定律,发现缩放行为取决于数据的统计结构,尤其是在临界点附近。
本文诊断了日语过去时动词屈折的神经形态生成中的系统性错误,聚焦于一个导致不成比例错误的罕见不规则子类型。消融实验表明,移除该子类型比移除所有不规则动词更能提高准确率,强调了细粒度子类分析的重要性。
作者使用LoRA对Qwen3.5 4B进行了微调,结合公开数据和合成数据创建了一个Jev风格模型,实现了性能提升,并开源了模型和数据集。
LLM2Jev是一个开源工具,它将本地HuggingFace模型适配为使用Choice、Score和Noul框架执行结构化决策,提供仅预填充推理,并与Transformers和SGLang集成。
本文回顾了 Manus AI 团队一年前关于上下文工程实践的博客文章,总结了构建 AI Agent 时的六项关键经验,包括上下文管理、记忆恢复和错误处理等。
本文详细解释了MoE(混合专家)推理工程,纠正了关于激活参数与部署成本的误解,并深入探讨了路由器选择、运行时分组、GPU执行、内存管理和专家并行等技术细节。
对BERT在2020年重要影响的怀旧反思,Hugging Face将其记录为 'BERTology',并引发了对大语言模型构成的讨论。
百度的开源Unlimited-OCR模型同时处理多个PDF页面,优于DeepSeek-OCR等基线模型,并支持本地执行与社区集成。
本文介绍了TranSGrid,一个集成演绎、归纳和溯因推理来评估AI中系统泛化的测试平台。使用Transformer的实验表明,当前的任务忽略了基本的推理方面,导致在所提出的测试平台上出现性能差距。
本文提出Cognitive Field Networks (CFNs),一种用于连续认知动力学的循环Transformer架构,实现了无需显式记忆系统的持续、历史依赖认知,灵感来源于生物启发理论。
本文研究了门控机制在State Space Models中的作用,表明它们促进记忆而非上下文学习,但能提高对长序列的泛化能力。