parameter-efficiency

标签

Cards List
#parameter-efficiency

LoopICL:通过循环复用单个 Transformer 块来解决表格任务

arXiv cs.LG ↗ · 昨天 缓存

LoopICL 通过复用一个权重共享的 Transformer 块(并采用双路 cell/row 流和一个可学习的出口门控),将参数量与模型深度解耦。在相同 FLOPs 下,其性能与 TabICL v2 在 TabArena/TALENT 上相当,但参数量减少了约 90%。

0 人收藏 0 人点赞
#parameter-efficiency

@TechByMarkandey: 如果进步不再意味着增加参数数量会怎样?

X AI KOLs Timeline ↗ · 2026-09-07 缓存

MiniCPM5-2B是一款拥有20亿参数的开源语言模型,其极高的智能密度使其非常适合边缘设备部署,并在多项AI性能测试中表现出色。

0 人收藏 0 人点赞
#parameter-efficiency

NanoSleep: 一种参数高效的混合时序卷积网络,用于单通道睡眠阶段分类

arXiv cs.LG ↗ · 2026-08-20 缓存

本文介绍了NanoSleep,这是一种参数高效的混合时序卷积网络,用于使用单通道脑电图(EEG)的自动睡眠阶段分类,专为资源受限设备上的可穿戴和家庭监测设计。

0 人收藏 0 人点赞
#parameter-efficiency

Wiola 13M,一种用于参数高效小型语言模型的门控螺旋注意力架构

arXiv cs.CL ↗ · 2026-08-18 缓存

本文介绍了Wiola,一个具有13M参数的仅解码器语言模型,采用螺旋旋转位置编码和门控螺旋注意力等新组件,以提升小型设备端语言模型的参数效率。

0 人收藏 0 人点赞
#parameter-efficiency

用于半导体热机械可靠性的递归Transformer

arXiv cs.LG ↗ · 2026-07-31 缓存

本文评估了递归权重共享Transformer架构作为参数高效的替代模型,用于半导体热机械可靠性预测,并在小型工程数据集上比较了性能、参数数量和计算成本。

0 人收藏 0 人点赞
#parameter-efficiency

在梯度与自然梯度之间:LoRA初始化的连续统

arXiv cs.LG ↗ · 2026-07-30 缓存

本文提出统一LoRA(ULoRA),一种用于低秩适配的双参数预条件梯度初始化家族,表明现有的LoRA初始化方法是该连续统上的点。作者证明,经过调优的ULoRA在RoBERTa-base上的GLUE任务中达到或超过全微调性能,并在LLaMA 2-7B上的GSM8K任务中具有竞争力,同时引入了ULoRA-Auto以实现零搜索部署。

0 人收藏 0 人点赞
#parameter-efficiency

利用LLM扩展闭环特征通道配置

arXiv cs.LG ↗ · 2026-07-24 缓存

本文将基于LLM的闭环通道配置搜索扩展到每周期250个候选,在CIFAR-100上展示了正向的准确率趋势和参数效率提升,并揭示了LLM生成的通道先验中的架构规律性。

0 人收藏 0 人点赞
#parameter-efficiency

SechKAN: 基于双曲正割函数的Kolmogorov-Arnold网络

arXiv cs.LG ↗ · 2026-07-22 缓存

SechKAN 是一种新颖的 Kolmogorov-Arnold 网络架构,使用双曲正割函数作为基函数,在函数拟合、偏微分方程问题和图像分类任务中取得了具有竞争力的性能,同时保持了与多层感知机相当的参数效率。

0 人收藏 0 人点赞
#parameter-efficiency

AsySplat: 用于长序列场景建模的高效非对称3D高斯泼溅

Hugging Face Daily Papers ↗ · 2026-07-13 缓存

AsySplat提出了一种非对称架构,将3D高斯泼溅中的几何和外观建模解耦,实现了长序列场景建模的高效率,相比基于优化的方法加速近800倍。

0 人收藏 0 人点赞
#parameter-efficiency

MultiHashFormer:基于哈希的生成式语言模型

arXiv cs.CL ↗ · 2026-06-29 缓存

MultiHashFormer是一种基于哈希的生成式语言模型,它通过将每个词元表示为独特的哈希签名,实现了参数高效的自回归。在1亿、10亿和30亿参数规模上,该模型均优于标准Transformer语言模型,并且能够在参数不变的情况下支持多语言词汇扩展。

0 人收藏 0 人点赞
#parameter-efficiency

@Fenng: 看到自媒体写的这么一段儿「最新的第四代 WeLM-80B,总参数已经只有 800 亿了,激活 30 亿,激活率只有 3.75%。作为对比——国内极致成本性能的代表 DeepSeek-V4-Flash,总参数 2840 亿、激活 130 亿…

X AI KOLs Timeline ↗ · 2026-06-23 缓存

Fenng shares a self-media comparison between the fourth-generation WeLM-80B (80B total params, 3B activated, 3.75% activation rate) and DeepSeek-V4-Flash (284B total, 13B activated, 4.6% activation rate), with a humorous comment.

0 人收藏 0 人点赞
#parameter-efficiency

Operator Boosting 生成帕累托高效的 PDE 替代模型

arXiv cs.LG ↗ · 2026-06-17 缓存

Operator Boosting 是一种逐阶段残差学习框架,通过在残差场上训练微型模型来构建紧凑的神经算子替代模型,用于求解 PDE。其精度可与全尺寸模型相媲美甚至更优,同时参数减少高达 95%,在多个基准测试中展示了帕累托改进。

0 人收藏 0 人点赞
#parameter-efficiency

Looped World Models

Hugging Face Daily Papers ↗ · 2026-06-16 缓存

Looped World Models 通过共享的Transformer块引入迭代潜在状态细化,实现了100倍的参数效率,同时根据预测复杂度自适应调整计算深度。

0 人收藏 0 人点赞
#parameter-efficiency

我仅能腾出小规模来摆弄Transformer

Reddit r/LocalLLaMA ↗ · 2026-06-11

一名学生介绍了Silia,这是一种新颖的Transformer架构,将注意力机制和前馈网络合并为统一操作,以在≤10M参数规模下节省参数,尽管计算资源有限,仍以更少的参数实现了与GPT-2相当的性能。

0 人收藏 0 人点赞
#parameter-efficiency

通信动力学神经网络:通过快速傅里叶变换对角化层减少参数数量并改善海森矩阵条件数

arXiv cs.LG ↗ · 2026-05-12 缓存

本文介绍了 CDLinear,这是一种分块循环神经网络层,通过快速傅里叶变换对角化技术减少参数量并改善海森矩阵条件数,并在 MNIST 数据集上结合理论证明进行了验证。

0 人收藏 0 人点赞
#parameter-efficiency

恕我无知,但27B模型怎么会比397B更强?

Reddit r/LocalLLaMA ↗ · 2026-04-22

用户质疑Qwen的27B稠密模型为何能胜过其397B MoE版本,引发关于MoE效率与稠密模型质量的讨论。

0 人收藏 0 人点赞
#parameter-efficiency

@aakashgupta:Karpathy 对 Dwarkesh 说,只要数据足够干净,10 亿参数的模型就能达到今天 1.8 万亿参数前沿模型的智能水平

X AI KOLs Timeline ↗ · 2026-04-22 缓存

Andrej Karpathy 向 Dwarkesh Patel 表示,用超干净数据训练的 10 亿参数模型可媲美当今 1.8 万亿参数的前沿模型,相当于 1,800 倍的有效压缩。

0 人收藏 0 人点赞
#parameter-efficiency

ShadowPEFT:面向参数高效微调的阴影网络

arXiv cs.CL ↗ · 2026-04-22 缓存

ShadowPEFT 提出一种集中式参数高效微调方法,通过深度共享的阴影模块细化 Transformer 层表示,在可训练参数量与 LoRA/DoRA 相当的情况下实现同等甚至更优的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈