标签
Ling-3.0-tiny发布:一款混合推理模型,总参数7.9B,每个token仅激活1.3B,免费一周。
LOLM的构建者宣布推出Qira开发的Transformer-SSM混合语言模型与智能体系统,具备实时决策控制器、运行收据、CLI、编码沙箱、MCP支持以及更低成本的托管访问。
Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.
本文提出了一种混合概率预测系统,将时间序列分解(Prophet)与自然语言处理技术相结合,应用于玻利维亚新闻报道以预测路障,相比纯统计模型,取得了改进的AUC-ROC和Brier分数。
本文介绍了ClickGuard,一款浏览器扩展,它结合了Transformer嵌入和语言学特征的混合机器学习模型,用于检测并识破点击诱饵新闻,在组合数据集上达到了91%的F1分数。
Cactus Hybrid是一款经过后训练的Gemma 4模型,可输出置信度分数,支持在设备端进行推理,并在置信度较低时路由至更大模型,以最少的大模型调用实现了与Gemini 3.1 Flash-Lite相当的性能。
本文提出了一种混合方法,用于检测英语和豪萨语中的在线极化现象。在英语中使用DeBERTa,在豪萨语及细粒度子任务中使用AfroXLMR-Social,并结合LoRA和数据增强以应对计算和数据限制。
MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。
Graham Neubig 分享了一种通过将简单任务委托给较小的智能体来降低LLM成本的 sidekick 架构,并提供了一个使用 OpenHands SDK 的200行示例。这种方法也被用于 Cognition 的 Devin Fusion 混合模型 harness。
提出HybridCodec,一种结合时间压缩离散令牌与连续残差的新颖框架,旨在改进语音语言模型中说话人特征的保留,在保持质量的同时减少自回归步骤。
Liquid AI发布了LFM2.5-230M,一款紧凑的230M参数混合模型,针对设备端部署进行了优化,边缘推理速度快(在Galaxy S25 Ultra上达到213 tok/s),并通过强化学习构建,适用于智能体任务。
AMD Strix Halo 设备上的 NPU 现在可用于 AI 推理,支持混合模式,结合 NPU 和 iGPU 以实现更快的提示处理。Lemonade 和 AMD 的 ROCm 等软件使之成为可能。
本文提出了一种混合NARX-LLM框架用于预测格陵兰冰山排放,采用物理知识提示方法引导大语言模型进行残差校正,相比传统NARX模型提高了预测精度。
D2H-AD是一种新颖的异常检测框架,采用超维计算(HDC),结合了基于距离和密度感知的编码。它在多个基准测试中优于五种基线方法,为边缘AI和物联网提供轻量级、可解释且高效的性能。
本文提出了一种用于神经主题建模的混合经典-量子变分自编码器,在推理网络中嵌入了参数化量子电路。在AgNews数据集上的实验表明,与最先进的经典模型相比,主题连贯性和多样性有所提高,显示了在NISQ时代量子设备上的可行性。
得益于对话式AI、可扩展性和性能一致性方面的进步,像 LuMay Voice Agent 和 Voxentis.ai 这样的AI语音代理正在加速取代传统呼叫中心,推动医疗、房地产、电商等行业采用AI与人类混合的模式。
DAStatFormer是一种混合多分支Transformer,它通过门控注意力机制整合统计特征,实现分布式声学传感(DAS)中高效且准确的事件分类,在显著降低计算成本的同时达到高达99.4%的准确率。
介绍QuChaTeR,一种混合架构,结合了小波预处理、混沌映射和变分量子电路与循环结构,用于地震预测,在收敛速度和准确性上优于经典和量子基线。
本文介绍了 TajPersLexon,这是一个用于塔吉克-波斯语跨脚本自然语言处理的词汇资源,并通过将混合模型与神经基线模型进行基准测试,展示了其在低资源环境下的有效处理能力。
Google 宣布推出 Gemini 2.5 Flash,这是一个新的混合推理模型,现已通过 Gemini API 以预览版形式提供。该模型具有可切换的思考能力、细粒度的思考预算以平衡质量、成本和延迟,并在保持快速推理速度的同时相比 2.0 Flash 提升了性能。