标签
会话自适应正交蒸馏(SAOD)是一种将7440亿参数模型(1.5TB)压缩至100GB以下的技术,大幅降低存储和推理成本。
Webfetch是一款工具,可为LLM智能体提供本地网页搜索,将令牌使用量减少87%,成本降低66%,提升效率。
本文提出了一种基于CTC的非自回归方法,用于阿拉伯语语音到文本的变音符号恢复,在解码过程中引入硬约束以提高效率并降低错误率。
Google DeepMind发布了Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,重点聚焦效率、编程和网络安全,但备受期待的Gemini 3.5 Pro因内部延迟而未包含在内。
Liquid AI 分享了原地升级预训练模型分词器的秘诀,将 LFM2.5 的分词器从 65K 扩展到 128K,以提高对泰语、越南语和印地语等语言的效率,结果使得令牌数量减少多达4倍,生成速度提升2.2-3.7倍。
SpecLA 提出了一种专为有状态线性注意力模型设计的推测解码运行时,在搭载 GDN-1.3B 目标模型的 NVIDIA H100 上,相比自回归解码实现了最高 1.70 倍的端到端加速。
本文介绍了C-MTP,一种用于训练连续思维链模型的直接监督方法,该方法将推理轨迹压缩为潜在表示。该方法在简单任务上表现良好,但揭示了直接和间接监督方法在处理复杂长推理轨迹时均存在困难,性能下降约65%。
HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。
Google正在设计一款新的AI服务器芯片Frozen v2,以提升其Gemini模型的效率,目标是比现有芯片实现6-10倍的提升,计划于2028年发布。
一种新工具或技术承诺将AI代理的上下文使用量减少66%,每年可为用户节省超过4000美元的AI成本。
SWE-Pruner Pro利用编程智能体自身的内部表示来修剪长代码上下文,可节省高达39%的令牌,同时保持或提升多轮基准测试中的任务性能。
RecGPT-V3 引入了一种有状态、混合模态的推荐系统,通过记忆中枢和潜在意图推理,将计算量减少55.8%,输出token成本降低200倍,在淘宝信息流中取得了显著收益。
讨论具有极端稀疏性(16/896专家)的LatentMoE架构以及Kimi Delta Attention,声称有2.5倍更高效的扩展,并猜测Kimi K3模型的能力。
AirLLM 是一个开源工具,通过分层流式加载,使得在单张8GB游戏显卡上运行4050亿参数模型成为可能,免费使用,采用Apache 2.0许可证。
本文介绍了xHC(扩展超连接),一种能够在Transformer中将残差流从原先的N=4限制有意义地扩展的方法,在18B和28B的MoE模型上取得了持续改进,且仅增加了适度的训练FLOPs。此外,还提出了xHC-Flash以减少内存流量,使得大型N残差流扩展在大语言模型预训练中变得实用。
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。
A.L.F.R.E.D.提出一种系统,将大模型的知识蒸馏到小模型中,并将简单任务路由给小模型,从而用2B模型实现35B模型的性能,同时将推理成本降低4倍。
中国发布了Ling-2.6-1T,一个1万亿参数的开源模型,在256K上下文窗口中SWE-bench上达到72.2%,声称高效且兼容Claude Code。