efficiency

标签

Cards List
#efficiency

研究机器翻译高效推理部署中的量化权衡

arXiv cs.CL · 6天前 缓存

本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。

0 人收藏 0 人点赞
#efficiency

通过低秩防御和电路引导代理的高效LLM对抗训练

arXiv cs.LG · 6天前 缓存

本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。

0 人收藏 0 人点赞
#efficiency

@Saboo_Shubham_:有人刚刚在单个CPU和8.24 GB内存环境下运行了拥有2.78万亿参数的Kimi k3模型。100%开源。

X AI KOLs Timeline · 6天前 缓存

据报道,有人仅用8.24 GB内存就在单个CPU上运行了拥有2.78万亿参数的开源Kimi k3模型,展现了极高的效率。

0 人收藏 0 人点赞
#efficiency

@Teknium:Hermes Agent 现在效率大幅提升,尤其是对于更小/更弱/本地模型!借助 @nvidia 的…

X AI KOLs Following · 6天前 缓存

得益于 Nvidia 的 Nemo Relay 以及多种优化策略,Hermes Agent 的效率大幅提升,尤其是对于更小/更弱的本地模型。这些优化包括减少任务轮次、降低上下文加载量,以及通过 25 万次对话消除 token 浪费。

0 人收藏 0 人点赞
#efficiency

3DZip: 面向3D问答的空间感知特征多样性引导的令牌压缩

Hugging Face Daily Papers · 2026-08-02 缓存

3DZip是一个面向3D视觉语言模型的三阶段令牌压缩框架,利用体素化、多样性引导的锚点选择和空间约束合并来减少令牌数量,同时保持空间推理能力。在3DQA基准上,仅使用128个令牌即可保留94.7%的原始性能,并实现1.92倍的推理加速。

0 人收藏 0 人点赞
#efficiency

构建丰裕智能

OpenAI Blog · 2026-07-31 缓存

OpenAI 讨论了其实现丰裕智能的战略,重点介绍了 GPT-5.6 模型的重大降价以及降低服务成本、提升性能的效率改进。

0 人收藏 0 人点赞
#efficiency

@sama: 它可以更快

X AI KOLs · 2026-07-31 缓存

山姆·奥特曼分享了一句关于真正优秀AI模型可能表现出的迹象的引述,例如尽管负载增加,可靠性却不断提升,效率也突然提高。

0 人收藏 0 人点赞
#efficiency

@thsottiaux:当我们开发出真正优秀的模型的那一天。会有迹象。尽管负载不断攀升,可靠性仍在提高。突然……

X AI KOLs Timeline · 2026-07-31 缓存

作者推测,真正先进的AI模型将表现出一些迹象,例如在负载不断增加的情况下可靠性提高、效率突然提升、性能变快以及重置。

0 人收藏 0 人点赞
#efficiency

Prox:通过近似中间通道显著性在LLM中实现免训练FFN激活稀疏性

arXiv cs.LG · 2026-07-31 缓存

Prox是一个用于LLM中稀疏SwiGLU FFN的免训练框架,利用近似中间通道显著性来构建通道掩码,无需密集计算。在十个LLM上,Prox优于免训练基线,在70%稀疏度下实现了高达1.99倍的端到端解码加速。

0 人收藏 0 人点赞
#efficiency

LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR

arXiv cs.CL · 2026-07-31 缓存

本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。

0 人收藏 0 人点赞
#efficiency

整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL · 2026-07-31 缓存

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。

0 人收藏 0 人点赞
#efficiency

SDO:面向高效LLM后训练的结构感知数据组织

arXiv cs.LG · 2026-07-31 缓存

本文介绍了SDO,一种用于LLM后训练的结构感知数据组织框架,利用暴露驱动的反馈来调整小批量组成和样本暴露,从而在SFT、DPO和GRPO中改善收敛性。

0 人收藏 0 人点赞
#efficiency

RLPF:面向代码生成的基于性能反馈的强化学习

arXiv cs.LG · 2026-07-31 缓存

RLPF 是一种强化学习方法,它在正确性之外还训练代码模型优化运行时间,使用基于执行进度和相对效率的分阶段奖励。在 PerfCodeBench 上使用 RLPF 微调 Qwen3-32B,将正确且可运行的解决方案从 11.1% 提高到 54.6%,并将相对效率从 8.1% 提高到 38.6%。

0 人收藏 0 人点赞
#efficiency

关于灯泡,你被误导了

Lobsters Hottest · 2026-07-30 缓存

一篇博客文章驳斥了一个常见误区:灯泡制造商合谋缩短灯泡寿命以牟利,并解释了白炽灯泡在寿命与效率之间的工程权衡。

0 人收藏 0 人点赞
#efficiency

@levie: AI成本(按任务类型标准化后)下降是推动AI进一步普及的最重要因素之一……

X AI KOLs Timeline · 2026-07-30 缓存

本文讨论了按任务类型标准化后AI成本下降如何推动进一步采用,并引用Sam Altman宣布的GPT-5.6系列模型大幅降价:Luna降价80%,Terra降价20%,Sol推出Fast模式。

0 人收藏 0 人点赞
#efficiency

@gdb:luna是一件美好的事物,能力超强且成本极低

X AI KOLs Timeline · 2026-07-30 缓存

一条推文强调Luna是一款能力超强且低成本的AI模型,指出它目前是每美元token效率最高的模型,并且在OpenRouter上还可享受额外折扣。

0 人收藏 0 人点赞
#efficiency

想用植物减少二氧化碳?

Hacker News Top · 2026-07-30 缓存

分析了使用室内植物降低室内二氧化碳浓度的理论和实践可行性,结论是需要不切实际的光照和植物表面积。

0 人收藏 0 人点赞
#efficiency

LinkedIn 未来一年内不会扩建数据中心

Wired · 2026-07-30 缓存

LinkedIn计划通过提高GPU效率,在下一个财年保持其计算和存储规模不变,这与其它大型科技公司积极扩建数据中心的趋势背道而驰。

0 人收藏 0 人点赞
#efficiency

GPT-5.6 Sol 帮助优化自身推理

Reddit r/singularity · 2026-07-29

OpenAI 的博客文章描述了新一代前沿模型 GPT-5.6 Sol 如何通过自我优化来提高自身推理效率,同时保持高智能水平。

0 人收藏 0 人点赞
#efficiency

@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…

X AI KOLs · 2026-07-29 缓存

OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈