mlp

标签

Cards List
#mlp

@ProfTomYeh: 自编码器手绘交互图示。访问 https://byhand.ai/autoencoder ~ Tom Yeh 教授

X AI KOLs Timeline · 昨天 缓存

Tom Yeh 教授分享了一个交互图示,用于学习自编码器,这是他专注于多层感知器的'AI by Hand'系列的一部分。

0 人收藏 0 人点赞
#mlp

我把 Bad Apple 压缩进了一个 3MB 的神经网络 [P]

Reddit r/MachineLearning · 2026-08-05

作者将 Bad Apple 动画压缩进了一个使用正弦激活(SIREN)的小型 MLP,仅用 79 万参数(约 3MB)表示 27 亿像素,并通过时间拉伸和运动聚焦采样等改进,使验证 MSE 降低了约 9 倍。

0 人收藏 0 人点赞
#mlp

Kolmogorov--Arnold网络在硬约束循环物理信息模型中的嵌入式RISC-V评估

arXiv cs.LG · 2026-08-04 缓存

本文在嵌入式RISC-V平台上评估了Kolmogorov–Arnold网络(KAN)与MLP作为硬约束循环物理信息网络中残差分支的性能,发现KAN运行更慢、能耗更高,且在INT8量化下可靠性较低。

0 人收藏 0 人点赞
#mlp

@andrew_n_carr: 事实证明,你可以在无需训练的情况下,将知识初始化到MLP中。Hazy Research刚刚表明,...

X AI KOLs Timeline · 2026-07-22 缓存

Hazy Research 表明,一个 MLP 可以在无需训练的情况下,通过嵌入知识进行初始化,然后一个 transformer 可以查询并使用该知识,这暗示了持续学习的能力。

0 人收藏 0 人点赞
#mlp

超越坐标规范:一种用于在Neural Collapse后检测供体特异性功能指纹的审计协议

arXiv cs.LG · 2026-07-15 缓存

本文提出了一种使用正交Procrustes对齐的审计协议,用于在Neural Collapse后检测神经网络中的供体特异性功能指纹,证明了在使用MLP-5网络对MNIST进行训练后,即使收敛后,不同的功能变化仍然可区分。

0 人收藏 0 人点赞
#mlp

MLP是Hebbian的:为Transformer构建高效的事实存储MLP

arXiv cs.LG · 2026-07-14 缓存

本文从理论上阐述了Transformer中的MLP如何以信息论最优速率存储事实,并提供了一种闭式构造方法,该方法以远少于先前方法的参数实现最优存储容量,并支持模块化事实编辑。

0 人收藏 0 人点赞
#mlp

通过格遍历的多层感知机区间认证

arXiv cs.AI · 2026-07-13 缓存

本文提出了一个严格的理论框架,用于多层感知机的对抗鲁棒性,通过将问题简化为格遍历,引入了具有形式化保证的可靠且完备的区间认证。

0 人收藏 0 人点赞
#mlp

Talos-XII: 用 Rust 手写自动求导 + 小型 RL/MLP 堆栈,应用于抽卡概率建模(不使用 tch-rs/ndarray/PyTorch)——寻求 ARM/AVX-512/GPU 上的基准测试帮助 [P]

Reddit r/MachineLearning · 2026-07-09

Talos-XII 是一个专为《明日方舟:终末地》抽卡系统设计的命令行模拟器,完全用 Rust 构建,带有自定义自动求导引擎和小型 RL/MLP 堆栈(无外部机器学习框架)。它使用神经网络进行环境建模和抽卡决策策略,并包含复杂的 SIMD 调度和一个名为 ACHF 的自适应缓存开放实验。

0 人收藏 0 人点赞
#mlp

基于神经网络权重的可观测性与位置编码相关的对称性读出

arXiv cs.LG · 2026-07-07 缓存

本文指出,从神经网络权重中可见的几何对称性取决于位置编码和读出可观测量,并通过在多个对称群下训练二维符号距离函数的MLP进行了验证。

0 人收藏 0 人点赞
#mlp

Aurora: 一种杠杆感知的谱优化器

arXiv cs.LG · 2026-06-29 缓存

Aurora是一种杠杆感知的谱优化器,通过强制执行行均匀性同时保留Muon更新的极因子几何结构来解决MLP层中的神经元死亡问题,在modded-nanoGPT speedrun基准上实现了最先进的性能。

0 人收藏 0 人点赞
#mlp

@N8Programs: 激动地宣布一篇关于我注意到的有趣数学对称性的 arXiv 笔记……它将经典MLP与…连接起来

X AI KOLs Timeline · 2026-06-23 缓存

宣布一篇关于数学对称性的 arXiv 笔记,该对称性将经典MLP与Gated MLP连接起来,超越了经验性能。

0 人收藏 0 人点赞
#mlp

Tapered Language Models

Hugging Face Daily Papers · 2026-06-22 缓存

本文介绍了Tapered Language Models (TLMs),一种架构原则,将更多参数分配给早期层,更少分配给后期层,在不增加额外成本的情况下,持续改善多种架构的困惑度和下游性能。

0 人收藏 0 人点赞
#mlp

Show HN:高分辨率 Neural Cellular Automata

Hacker News Top · 2026-06-17 缓存

介绍了一种高分辨率 Neural Cellular Automata,它运行在粗网格上,并使用 Local Pattern Producing Network 生成高分辨率输出,从而实现高效的程序化生成。

0 人收藏 0 人点赞
#mlp

@ariG23498: 现在是性能分析时间!在第2部分中,我们涵盖:> 追踪线性层 > 讨论 mul + add 与 linear 的对比 > gemm epilogues (我最…

X AI KOLs Timeline · 2026-06-11 缓存

宣布性能分析教程的第2部分,涵盖线性层追踪、gemm epilogues、MLP追踪以及torch compile与Liger内核的对比,并附有完整内容的链接。

0 人收藏 0 人点赞
#mlp

不要让LLM说话,直接探测它(8分钟阅读)

TLDR AI · 2026-06-11 缓存

本文介绍了一种技术,该技术从LLM的最后一个提示标记处提取隐藏状态,无需文本生成即可进行分类,使用一个小型MLP读取模型的内部决策,从而实现快速且廉价的零样本分类器。

0 人收藏 0 人点赞
#mlp

PyTorch 性能分析(第 2 部分):从 nn.Linear 到融合 MLP

Hugging Face Blog · 2026-06-11 缓存

本篇博文继续 PyTorch 性能分析系列内容,探讨 nn.Linear、MLP 块以及使用 Triton 内核的融合技术,以优化性能。

0 人收藏 0 人点赞
#mlp

KAN-MLP-Mixer: 关于使用 Kolmogorov-Arnold Networks (KANs) 改进基于 IMU 的人类活动识别的全面研究

arXiv cs.AI · 2026-05-20 缓存

本文系统地探索了混合 KAN 和 MLP 架构用于基于 IMU 的人类活动识别,相比纯 MLP 基线实现了 5.33% 的平均宏 F1 改进。

0 人收藏 0 人点赞
#mlp

@NousResearch: 为了检查CNA是否只隔离了预期行为,我们评估了MMLU上不同转向强度下的转向模型……

X AI KOLs Following · 2026-05-19 缓存

Nous Research 发布了对比神经元归因(CNA),这是一种通过识别和消融MLP神经元中稀疏电路来引导LLM行为的方法,无需训练稀疏自编码器或降低通用基准性能,已在多个大型语言模型上得到验证。

0 人收藏 0 人点赞
#mlp

@NousResearch:今天我们发布对比神经元归因(CNA),一种通过识别和消融稀疏电路来引导LLM行为的方法…

X AI KOLs Following · 2026-05-19 缓存

NousResearch 发布了对比神经元归因(CNA),该方法通过消融稀疏的 MLP 电路来引导 LLM 行为,无需训练稀疏自编码器或降低基准测试性能,并在多达 70B 参数的模型的拒绝电路上验证了有效性。

0 人收藏 0 人点赞
#mlp

语言切换触发器在语言模型中的潜在绕行路径

Hugging Face Daily Papers · 2026-05-18 缓存

本文识别了在80亿参数语言模型中语言切换后门的底层电路,其中三个词的拉丁触发器通过注意力头和正交潜在子空间将英语输出重定向为法语,最后一层的MLP将潜在信号转换为法语logits。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈