theory

标签

Cards List
#theory

为什么在神经网络中植入后门如此容易?

arXiv cs.LG ↗ · 7小时前 缓存

该论文推导出了精确的解析解,表明神经网络中的特征学习使其更容易遭受后门攻击:在特征学习机制下,仅需触发强度满足 α ∝ π^{-1/4},而惰性学习机制则需要 α ∝ π^{-1/2}——这一结果从理论上解释了为何给大型网络植入后门出乎意料地容易,以及为何线性安全审计会低估这一威胁。

0 人收藏 0 人点赞
#theory

目标的句法与语义

arXiv cs.AI ↗ · 2026-09-18 缓存

本文探讨目标表示的句法和语义,分析其组合性在认知科学和人工智能中理性行为中的作用。

0 人收藏 0 人点赞
#theory

数学与物理学的关系 by Paul Dirac

Hacker News Top ↗ · 2026-09-13

Paul Dirac 探讨了数学与物理学之间的深刻联系,强调了它们在科学框架中的相互依赖性。

0 人收藏 0 人点赞
#theory

@randall_balestr: 今天将在9:45于哈佛大学谈论世界模型、Le*家族以及为何我们需要更多理论和数学来…

X AI KOLs Following ↗ · 2026-09-11 缓存

作者宣布将在哈佛大学进行演讲,讨论世界模型、Le*家族,以及为何需要更多理论和数学来推进JEPAs。

0 人收藏 0 人点赞
#theory

学习动态统计力学的函数空间方法

arXiv cs.AI ↗ · 2026-09-11 缓存

本文通过从参数空间转向函数空间,开发了一个统计力学框架来分析深度神经网络中的学习动态,推导了精确的误差动态和涨落效应。

0 人收藏 0 人点赞
#theory

Bit Radix 理论 — 人类与AI之间以及所有生命的认知 (附AI摘要)

Reddit r/ArtificialInteligence ↗ · 2026-08-29

Bit Radix 理论认为,不同形式的智能,如人类和AI,可能具有根本上不同的认知方式,而非趋同,强调互补优势。该论文通过邀请读者使用AI工具测试该理论,促进开放批判性参与。

0 人收藏 0 人点赞
#theory

具有有限Newton-Schulz的Muon:非光滑非凸优化中的平滑益处

arXiv cs.LG ↗ · 2026-08-28 缓存

本文分析了Muon优化器中的有限Newton-Schulz迭代如何通过平滑极映射使非光滑非凸优化受益,提供了匹配最佳已知界限的收敛保证。

0 人收藏 0 人点赞
#theory

朝向以单元作为原语的机器学习:从单元关联事件中学习

arXiv cs.LG ↗ · 2026-08-27 缓存

本文提出将'单元'作为机器学习中的显式原语,其中学习任务声明持久个体,而监督学习则特化为带有分词的单元条件响应法则。

0 人收藏 0 人点赞
#theory

GLM 5.3 Flash 版本?

Reddit r/LocalLLaMA ↗ · 2026-08-25

这篇文章推测了即将发布的 GLM 5.3 权重,并提出 OxAlpha 可能是 GLM 的一个新模型变体。

0 人收藏 0 人点赞
#theory

意识的起源 (2008)

Hacker News Top ↗ · 2026-08-17 缓存

这篇文章讨论了Julian Jaynes的理论,认为人类意识是近期才发展起来的,大约在3000年前由于大脑整合方式的转变而出现,并得到历史和神经学证据的支持。

0 人收藏 0 人点赞
#theory

你的概率JEPA实际上是一个隐马尔可夫模型:联合嵌入预测学习的状态空间解释

arXiv cs.AI ↗ · 2026-08-17 缓存

本文建立了概率联合嵌入预测学习(JEPA)与隐马尔可夫模型(HMM)之间的理论联系,提供了状态空间解释,并引入了马尔可夫链JEPA以增强一致性。

0 人收藏 0 人点赞
#theory

如今机器学习中是否还有理论指导的实践? [D]

Reddit r/MachineLearning ↗ · 2026-08-14

文章探讨理论原则是否仍指导机器学习实践,强调许多曾被视为标准的理论如何被经验证据所挑战。

0 人收藏 0 人点赞
#theory

论Transformer的表达能力

arXiv cs.AI ↗ · 2026-08-14 缓存

一篇综述论文,考察Transformer作为语言识别器的表达能力,运用电路复杂性的概念和方法将其与经典计算模型进行比较。

0 人收藏 0 人点赞
#theory

Low-Interaction-Rank Learning: Unifying Multiplicative Dual-Encoder Heads

arXiv cs.LG ↗ · 2026-08-13 缓存

This paper introduces low interaction rank as a unified theoretical framework for multiplicative dual-encoder networks, covering approximation, sample complexity, normalization, and identifiability, with experiments on operator learning and CLIP models.

0 人收藏 0 人点赞
#theory

Three Tokens Force Exponential Feature Rank in Nonnegative Kernel Attention

arXiv cs.LG ↗ · 2026-08-13 缓存

This paper proves that a single normalized nonnegative kernel-attention head requires exponentially many features to solve a simple Min-IP task on three-token sequences, whereas dense softmax attention solves it with constant temperature and m-dimensional scores, highlighting a fundamental expressive-power gap between kernel and full attention.

0 人收藏 0 人点赞
#theory

构建视角的空间结构

arXiv cs.CL ↗ · 2026-08-13 缓存

本文回顾了NLP中“视角”的概念,提出了沿特定性轴排列的视角相关概念层级,并展示了该层级如何帮助研究者选择恰当的操作化定义。

0 人收藏 0 人点赞
#theory

Decoupled Descent:通过AMP Onsager修正强制实现精确的训练-测试误差追踪 [R]

Reddit r/MachineLearning ↗ · 2026-08-11

一篇理论论文,介绍了Decoupled Descent (DD),一种训练方法,它利用近似消息传递(AMP)的Onsager修正来在梯度下降过程中强制训练误差与测试误差之间的渐近相等,从而可能实现更好的停止和超参数调整。

0 人收藏 0 人点赞
#theory

Information Routing across Batch Boundaries: Memory--Batch Tradeoffs in Lipschitz Bandits

arXiv cs.LG ↗ · 2026-08-11 缓存

This paper studies the joint effect of memory width and batch depth in stochastic Lipschitz bandits, characterizing the minimax pseudo-regret tradeoff up to logarithmic factors and showing that state width and update depth are not interchangeable.

0 人收藏 0 人点赞
#theory

The Sample Complexity of Policy Learning with Mu-Resets

arXiv cs.LG ↗ · 2026-08-11 缓存

This paper studies the sample complexity of policy learning under the mu-resets interaction protocol in reinforcement learning, resolving a question about the role of policy realizability and showing horizon dependence is exponential under all-policy concentrability and sqrt-exponential under pushforward concentrability.

0 人收藏 0 人点赞
#theory

平均奖励强化学习的有限常数前沿与可审计遗憾证书

arXiv cs.LG ↗ · 2026-08-11 缓存

本文为平均奖励强化学习遗憾界引入了一种常数感知的比较协议,为通信MDP导出了显式的有限下界证书,并改进了已发表的系数。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈