标签
这篇文章声称提出了一种理论方法来破解Anthropic的AI水印,批评欧盟可能因此增加计算需求,并链接到一个相关的GitHub仓库。
本文量化并扩展了晚期交互检索模型的理论容量,证明MaxSim可以复制非负向量之间的内积,并提出适用于任意实值向量的Signed MaxSim,揭示了内积模型与晚期交互模型之间的表示差距。
推导了损失Hessian特征谱的Wolkowicz-Styan上界的闭式梯度,以引导神经网络训练朝向平坦极小值,并提出了Hessian谱范围(HSR)正则化。数值实验表明,HSR收窄了Hessian特征值范围,避免了尖锐极小值和鞍点,并实现了与Sharpness-Aware Minimization(SAM)相当的解。
本书提出了深度表示学习的数学理论,旨在利用优化和信息论揭开大型深度网络内部机制的神秘面纱,使架构设计成为线性代数和微积分的问题。
本文证明了在高阶光滑非凸优化中寻找ε-稳定点的无维数尖锐一阶下界,解决了Hessian-Lipschitz和三阶光滑情况下的公开问题。
本文识别了流形假设下扩散模型中的坍缩与精炼机制,提出了分数诱导潜在扩散(SiLD),该方法可证明地避免了维度灾难。实验表明,SiLD在生成质量上匹配或超越基于VAE的潜在扩散模型。