efficiency

标签

Cards List
#efficiency

会话自适应正交蒸馏(SAOD)技术将744B(1.5TB)压缩至100GB以下?

Reddit r/LocalLLaMA · 2026-07-22

会话自适应正交蒸馏(SAOD)是一种将7440亿参数模型(1.5TB)压缩至100GB以下的技术,大幅降低存储和推理成本。

0 人收藏 0 人点赞
#efficiency

Webfetch - 面向LLM智能体的本地网页搜索,减少87%令牌使用量并降低66%成本

Reddit r/AI_Agents · 2026-07-22

Webfetch是一款工具,可为LLM智能体提供本地网页搜索,将令牌使用量减少87%,成本降低66%,提升效率。

0 人收藏 0 人点赞
#efficiency

受限CTC解码实现高效变音符号恢复

arXiv cs.CL · 2026-07-22 缓存

本文提出了一种基于CTC的非自回归方法,用于阿拉伯语语音到文本的变音符号恢复,在解码过程中引入硬约束以提高效率并降低错误率。

0 人收藏 0 人点赞
#efficiency

谷歌发布三款全新Gemini模型——但未包含3.5 Pro

TechCrunch AI · 2026-07-21 缓存

Google DeepMind发布了Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,重点聚焦效率、编程和网络安全,但备受期待的Gemini 3.5 Pro因内部延迟而未包含在内。

0 人收藏 0 人点赞
#efficiency

@maximelabonne: 如何为模型添加新语言?高效的分词在此中扮演关键角色。在这篇新博文中,我们讨论…

X AI KOLs Following · 2026-07-21 缓存

Liquid AI 分享了原地升级预训练模型分词器的秘诀,将 LFM2.5 的分词器从 65K 扩展到 128K,以提高对泰语、越南语和印地语等语言的效率,结果使得令牌数量减少多达4倍,生成速度提升2.2-3.7倍。

0 人收藏 0 人点赞
#efficiency

相同模型,相同使用限制:4倍运营差距如何产生(示例模型)

Reddit r/ArtificialInteligence · 2026-07-21

一个示例模型,解释在相同模型和使用限制下如何出现4倍运营差距,突出效率差异机制。

0 人收藏 0 人点赞
#efficiency

SpecLA:面向线性注意力模型的高效推测解码

arXiv cs.CL · 2026-07-21 缓存

SpecLA 提出了一种专为有状态线性注意力模型设计的推测解码运行时,在搭载 GDN-1.3B 目标模型的 NVIDIA H100 上,相比自回归解码实现了最高 1.70 倍的端到端加速。

0 人收藏 0 人点赞
#efficiency

训练连续思维链模型:两种机制的故事

arXiv cs.AI · 2026-07-21 缓存

本文介绍了C-MTP,一种用于训练连续思维链模型的直接监督方法,该方法将推理轨迹压缩为潜在表示。该方法在简单任务上表现良好,但揭示了直接和间接监督方法在处理复杂长推理轨迹时均存在困难,性能下降约65%。

0 人收藏 0 人点赞
#efficiency

HPD-Parsing:层次化并行文档解析

Hugging Face Daily Papers · 2026-07-21 缓存

HPD-Parsing 引入了一种面向基于VLM的文档解析的层次化并行解码范式,取代整页自回归生成,实现了每秒4752个令牌的吞吐量(比先前模型快2.62倍),同时保持了有竞争力的准确率。

0 人收藏 0 人点赞
#efficiency

Google正在研发一款新AI芯片,旨在提升Gemini的效率

TechCrunch AI · 2026-07-20 缓存

Google正在设计一款新的AI服务器芯片Frozen v2,以提升其Gemini模型的效率,目标是比现有芯片实现6-10倍的提升,计划于2028年发布。

0 人收藏 0 人点赞
#efficiency

将AI代理的上下文削减66%,每年节省4000美元以上

Reddit r/openclaw · 2026-07-20

一种新工具或技术承诺将AI代理的上下文使用量减少66%,每年可为用户节省超过4000美元的AI成本。

0 人收藏 0 人点赞
#efficiency

减少模型参数大小?

Reddit r/LocalLLaMA · 2026-07-20

讨论减少模型参数大小的方法或研究,可能侧重于剪枝或量化等技术以提高效率。

0 人收藏 0 人点赞
#efficiency

SWE-Pruner Pro:编程大语言模型早已知道该修剪什么

Hugging Face Daily Papers · 2026-07-20 缓存

SWE-Pruner Pro利用编程智能体自身的内部表示来修剪长代码上下文,可节省高达39%的令牌,同时保持或提升多轮基准测试中的任务性能。

0 人收藏 0 人点赞
#efficiency

RecGPT-V3 技术报告

Hugging Face Daily Papers · 2026-07-17 缓存

RecGPT-V3 引入了一种有状态、混合模态的推荐系统,通过记忆中枢和潜在意图推理,将计算量减少55.8%,输出token成本降低200倍,在淘宝信息流中取得了显著收益。

0 人收藏 0 人点赞
#efficiency

@nrehiew_: > LatentMoE > 896个专家中激活16个 > Kimi Delta Attention 和 AttnRes > 2.5倍更高效的扩展 这是……

X AI KOLs Timeline · 2026-07-16 缓存

讨论具有极端稀疏性(16/896专家)的LatentMoE架构以及Kimi Delta Attention,声称有2.5倍更高效的扩展,并猜测Kimi K3模型的能力。

0 人收藏 0 人点赞
#efficiency

@dunik_7: 他让4050亿参数的模型在单张8GB游戏显卡上运行。他没有将其转为付费服务,而是开源了……

X AI KOLs Timeline · 2026-07-16 缓存

AirLLM 是一个开源工具,通过分层流式加载,使得在单张8GB游戏显卡上运行4050亿参数模型成为可能,免费使用,采用Apache 2.0许可证。

0 人收藏 0 人点赞
#efficiency

xHC:扩展超连接

Hugging Face Daily Papers · 2026-07-16 缓存

本文介绍了xHC(扩展超连接),一种能够在Transformer中将残差流从原先的N=4限制有意义地扩展的方法,在18B和28B的MoE模型上取得了持续改进,且仅增加了适度的训练FLOPs。此外,还提出了xHC-Flash以减少内存流量,使得大型N残差流扩展在大语言模型预训练中变得实用。

0 人收藏 0 人点赞
#efficiency

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending · 2026-07-16 缓存

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。

0 人收藏 0 人点赞
#efficiency

A.L.F.R.E.D.: 带模板的2B模型能以4倍更低速度匹配35B模型

Reddit r/LocalLLaMA · 2026-07-15

A.L.F.R.E.D.提出一种系统,将大模型的知识蒸馏到小模型中,并将简单任务路由给小模型,从而用2B模型实现35B模型的性能,同时将推理成本降低4倍。

0 人收藏 0 人点赞
#efficiency

@thesupermanmx: 中国刚刚改变了游戏规则。他们发布了一个开源模型,仅消耗你们最喜欢的美国模型1%的token…

X AI KOLs Timeline · 2026-07-15 缓存

中国发布了Ling-2.6-1T,一个1万亿参数的开源模型,在256K上下文窗口中SWE-bench上达到72.2%,声称高效且兼容Claude Code。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈