efficiency

标签

Cards List
#efficiency

@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…

X AI KOLs · 2026-07-29 缓存

OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。

0 人收藏 0 人点赞
#efficiency

@reach_vb: Hola!关于 Sol 使用模式的快速更新:我们已发布了几项改进,应能使典型的 Sol 使用时间延长约 18%……

X AI KOLs Following · 2026-07-29 缓存

Sol,ChatGPT Work 和 Codex 的 AI 助手,获得了提升,使其使用时间更长、效率更高,同时重置了使用限制并恢复了五小时限制。

0 人收藏 0 人点赞
#efficiency

神经形态扩散语言模型:通过稀疏性和块去噪解决计算与内存瓶颈

arXiv cs.CL · 2026-07-29 缓存

提出神经形态掩码扩散语言模型(N-MDLMs),该模型将块扩散与基于尖峰的神经形态计算相结合,通过利用稀疏性和每次参数访问生成多个token来提高吞吐量和能效,并通过类屋顶线模型进行分析。

0 人收藏 0 人点赞
#efficiency

GPT-5.6如何融合前沿智能与前沿效率

OpenAI Blog · 2026-07-29 缓存

OpenAI发布了GPT-5.6模型系列,包括Sol、Terra和Luna,这些模型在显著提升效率和降低成本的同时实现了前沿智能,背后是推理和智能体框架的创新。

0 人收藏 0 人点赞
#efficiency

Kimi K3 架构概述与笔记

Hacker News Top · 2026-07-28 缓存

Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。

0 人收藏 0 人点赞
#efficiency

Kimi Linear: 一种富有表现力且高效的注意力架构

Hacker News Top · 2026-07-28 缓存

Kimi Linear 提出了一种新的线性注意力架构,旨在增强Transformer模型的表达能力和效率,由 Moonshot AI 的 Kimi 团队贡献。

0 人收藏 0 人点赞
#efficiency

TriSP: 三信号结构化剪枝用于大语言模型

arXiv cs.AI · 2026-07-28 缓存

TriSP 提出了一种三信号重要性度量,结合权重幅度、激活范数和梯度敏感性,用于大语言模型的结构化剪枝,在 LLaMA-7B 上实现了最低困惑度和高吞吐量提升。

0 人收藏 0 人点赞
#efficiency

@charliermarsh: Tibo 是在说我的小字符串优化工作吗?

X AI KOLs Following · 2026-07-28 缓存

Charlie Marsh 问 Tibo 对 GPT-5.6 Sol 性能和效率提升的赞扬是否指的是他的小字符串优化工作。

0 人收藏 0 人点赞
#efficiency

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers · 2026-07-28 缓存

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。

0 人收藏 0 人点赞
#efficiency

OmniDelta: 面向OmniLLM令牌压缩的技能驱动预算分配

Hugging Face Daily Papers · 2026-07-28 缓存

OmniDelta提出了一种无需训练、技能驱动的框架,用于在OmniLLM的音频和视频模态间分配令牌预算,在保留25%令牌时实现了GPU内存减少22%和1.64倍加速,改善了精度-效率权衡。

0 人收藏 0 人点赞
#efficiency

Qwen3.6-27B 推测解码在更大量化下性能提升

Reddit r/LocalLLaMA · 2026-07-27

Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。

0 人收藏 0 人点赞
#efficiency

RED-PIM: 使用处理内存减少Transformer的数据移动

arXiv cs.LG · 2026-07-27 缓存

提出了RED-PIM,一种算法-架构协同设计,将内存体间的数据移动从O(N²)降低到O(N),并缩小注意力矩阵,使Transformer模型的推理时间显著降低(16%到99.99%)。

0 人收藏 0 人点赞
#efficiency

Mage-VL:一种高效的编解码原生流式多模态基础模型

Hugging Face Daily Papers · 2026-07-27 缓存

Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。

0 人收藏 0 人点赞
#efficiency

ARC-AGI 排行榜

Hacker News Top · 2026-07-25 缓存

ARC-AGI排行榜展示了模型在基准的三个版本上的性能,衡量流体智力和高效适应能力,并附有推理系统和原始LLM的趋势线。

0 人收藏 0 人点赞
#efficiency

数据科学家角色的统计学家如何将AI融入工作流程以最大化工作效率?

Reddit r/ArtificialInteligence · 2026-07-25

一位统计学家提出了一种工作流程,其中AI用于头脑风暴和演示文稿格式化,而人类专家则负责核心定量分析以保持准确性。

0 人收藏 0 人点赞
#efficiency

@burny_tech: 关于优化器魔法的更新

X AI KOLs Timeline · 2026-07-24 缓存

一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。

0 人收藏 0 人点赞
#efficiency

解码速度是智能体循环中无人预算的延迟代价

Reddit r/AI_Agents · 2026-07-24

讨论AI智能体循环中被忽视的解码速度延迟成本,影响整体性能。

0 人收藏 0 人点赞
#efficiency

DeepSeek的Huawei芯片训练声明终于有了基准测试和质疑者(3分钟阅读)

TLDR AI · 2026-07-24 缓存

一个由华为主导的联合体发布了基准测试,显示在Ascend芯片上对DeepSeek的V4模型进行高效后训练,但专家指出这仅涵盖后训练,并不能证明华为可以替代英伟达进行完整的预训练。

0 人收藏 0 人点赞
#efficiency

@Suhail:面对开放权重模型限制的威胁,蒸馏研究将增加10倍。它将引起史翠珊效应…

X AI KOLs Following · 2026-07-23

Suhail预测,对开放权重模型的限制将导致蒸馏研究增加10倍,以此戏弄政府,并可能使AI更高效。

0 人收藏 0 人点赞
#efficiency

一个穴居人版 qwen3.6 27B

Reddit r/LocalLLaMA · 2026-07-23

一种名为 grug-27b 的新模型声称性能优于 qwen3.6 27B,同时将 token 使用量减少超过 90%,这可能使其在消费级硬件上运行更快。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈