efficient-ai

标签

Cards List
#efficient-ai

QVAC Genesis III: 一个大规模、高质量的开放合成 STEM 语料库,用于高效语言模型预训练

arXiv cs.AI ↗ · 2026-09-18 缓存

QVAC Genesis III 是一个开源的合成 STEM 语料库,旨在提升语言模型预训练的效率,与先前的数据集相比,在基准测试中表现出显著改进。

0 人收藏 0 人点赞
#efficient-ai

@EmperoAI: Qwen3.8-35B-A3B-Distill - 我们的首个MoE模型。Qwen3.8推理能力蒸馏至Qwen3.6-35B-A3B:总参数35B,活跃参数约3B。ARC-C…

X AI KOLs Following ↗ · 2026-09-16 缓存

Empero AI发布其首个MoE模型Qwen3.8-35B-A3B-Distill,该模型将Qwen3.8的推理能力蒸馏到一个更小、更高效的架构中,在ARC-Challenge基准测试上显示出改进。

0 人收藏 0 人点赞
#efficient-ai

@LeoKharon: 新世界模型:ylecun的团队带着高效模型回归!此项目涉及@ylecun、@lukaskuhn77、@lucasmae…

X AI KOLs Timeline ↗ · 2026-08-31 缓存

LeVJEPA引入了一种更高效的自监督视频预训练方法,通过消除对目标网络和预测器的需求,使用带有SIGReg正则化器的单一共享编码器,并以更低的计算成本实现有竞争力的性能。

0 人收藏 0 人点赞
#efficient-ai

BF1: 用于高效长上下文Transformer的因果二元稀疏注意力改造

arXiv cs.LG ↗ · 2026-08-24 缓存

本文介绍BF1,一种因果二元稀疏注意力改造,旨在提升Transformer在长上下文处理中的效率。

0 人收藏 0 人点赞
#efficient-ai

GRNEdit:基于生成细化网络中新二进制证据视角的高效通用视频编辑

Hugging Face Daily Papers ↗ · 2026-08-17 缓存

GRNEdit是一个轻量级的两阶段框架,用于高效通用视频编辑,通过使用二进制语义决策和源证据,以比大型模型更少的参数实现高性能。

0 人收藏 0 人点赞
#efficient-ai

DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

Hugging Face Daily Papers ↗ · 2026-08-11 缓存

DistilVDR is a compact 524M visual document retriever distilled from an 8B teacher via cosine alignment, achieving near-teacher accuracy on ViDoRe with 15.6x smaller indexes and faster indexing.

0 人收藏 0 人点赞
#efficient-ai

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL ↗ · 2026-08-06 缓存

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。

0 人收藏 0 人点赞
#efficient-ai

@AdinaYakup:Ling 3.0 flash 是来自 @AntLingAGI Ling 系列的原生混合线性推理模型,其核心是:强大的推理性能…

X AI KOLs Following ↗ · 2026-08-05 缓存

AntLingAGI 发布 Ling 3.0 flash,一个原生混合线性推理模型,总参数 124B,激活参数 5.1B,采用 MIT 许可证,声称以更少的计算量和更快的响应速度媲美 1T 参数的旗舰模型。

0 人收藏 0 人点赞
#efficient-ai

Show HN:Maple-Preview——在 iPhone 上以 120 tok/s 运行的三值 20B MoE

Hacker News Top ↗ · 2026-08-04

Maple-Preview 是一个三值 20B MoE 模型,在 iPhone 上每秒可运行 120 个 token,展现了高效的端侧推理能力。

0 人收藏 0 人点赞
#efficient-ai

有人试过 Mach-1 Additive 吗?性能是 Qwen 3.6 35B 的95%,体积却小10倍

Reddit r/LocalLLaMA ↗ · 2026-08-04

用户询问关于 Mach-1 Additive 的情况,据称该模型在体积小10倍的情况下,实现了 Qwen 3.6 35B 95% 的性能,并质疑为什么它没有得到更广泛的讨论。

0 人收藏 0 人点赞
#efficient-ai

@Dinosaur_liu: 给全部中美模型厂商说个鬼故事 DeepSeek V4 Flash 只有284b参数 激活参数只有区区13b

X AI KOLs Timeline ↗ · 2026-08-03 缓存

据称 DeepSeek V4 Flash 仅有2840亿参数,激活参数仅130亿,对中美模型厂商构成效率冲击。

0 人收藏 0 人点赞
#efficient-ai

Inkling-Small(4分钟阅读)

TLDR AI ↗ · 2026-07-31 缓存

Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。

0 人收藏 0 人点赞
#efficient-ai

LFM2.5-编码器:用于CPU上快速长上下文推理

Hugging Face Blog ↗ · 2026-07-28 缓存

Liquid AI发布LFM2.5-编码器(230M和350M),这是为CPU上长上下文推理优化的高效编码器模型,在基准测试中匹配或超越更大编码器,相比ModernBERT-base实现3.7倍加速。

0 人收藏 0 人点赞
#efficient-ai

Gemma 4 26B A4B 通过模型分页在 iPhone 17 Pro 上运行

Reddit r/LocalLLaMA ↗ · 2026-07-24

谷歌的 Gemma 4 26B A4B 模型可通过模型分页在 iPhone 17 Pro 上运行,实现强大的设备端 AI 功能。

0 人收藏 0 人点赞
#efficient-ai

@VukRosic99: NVFP4端到端训练发散。当前方案通过Hadamard变换、随机舍入、高精度层等方式修补,但牺牲了大部分加速优势。

X AI KOLs Timeline ↗ · 2026-07-10 缓存

Four Over Six(4/6)为NVFP4量化引入了自适应块缩放,以最小开销降低量化误差,同时改善了大语言模型的训练和训练后量化。

0 人收藏 0 人点赞
#efficient-ai

蚂蚁集团发布LingBot-Vision:DINO系列视觉骨干网络,提供四种规模,其中0.3B参数的ViT-L在NYUv2深度估计任务上以约23倍更少的参数量达到与DINOv3-7B相当的性能

Reddit r/LocalLLaMA ↗ · 2026-07-06

蚂蚁集团发布了LingBot-Vision,这是一个包含四种规模的DINO风格视觉骨干网络系列;其中0.3B ViT-L在NYUv2深度估计任务上,以约23倍更少的参数量达到了DINOv3-7B的性能,展现了显著的效率提升。

0 人收藏 0 人点赞
#efficient-ai

@Phoenixyin13: 现在的人工智能领域陷入了一个非此即彼的怪圈。 一边是统治世界的 Transformer 架构,它记性极好,但由于计算量呈平方级爆炸,长文本读得越多就越贵,活脱脱一个吞金兽。 另一边是老牌的 RNN 架构,计算速度极快,成本很低,但它是个彻…

X AI KOLs Timeline ↗ · 2026-06-07 缓存

本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。

0 人收藏 0 人点赞
#efficient-ai

@vintcessun: 预训练原来可以这么省?1B模型、~$1000就能从零训出可用的基础模型,计算和数据量直接砍掉数百倍。核心不靠堆算力,而是层次递归架构加上潜在空间推理,配合PrefixLM packing和FA3把效率拉满。有点离谱,但论文和代码都开源了。

X AI KOLs Timeline ↗ · 2026-06-05 缓存

HRM-Text发布了一个1B参数的基础模型,声称仅需约$1000即可从零完成预训练,计算量和数据量减少数百倍,采用层级递归架构、潜在空间推理和PrefixLM packing等高效技术,论文与代码均已开源。

0 人收藏 0 人点赞
#efficient-ai

1-Bit Bonsai Image 4B 本地设备图像生成

Hacker News Top ↗ · 2026-05-31 缓存

PrismML 发布 Bonsai Image 4B,这是一系列紧凑型图像生成模型,使用 1-bit 和三进制权重,能够在笔记本电脑和 iPhone 等本地设备上实现高质量扩散推理,同时显著减少内存占用。

0 人收藏 0 人点赞
#efficient-ai

@ickma2311: 高效AI讲座15:长上下文LLM 长上下文不仅仅是更大的提示窗口。关键问题是:哪些过…

X AI KOLs Timeline ↗ · 2026-05-25 缓存

本文总结了关于长上下文LLM的高效AI讲座15,涵盖用于上下文扩展的RoPE位置插值、大海捞针评估,以及StreamingLLM的注意力汇聚现象和KV缓存驱逐策略。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈