标签
本文提出gradCSCG,一种对克隆结构因果图算法的可微重构,用于直接从图像序列端到端学习认知地图,并结合向量量化变分自编码器。
一篇研究论文,提出了Color Pass-Through,这是一个端到端学习框架,将相机和显示器视为一个耦合系统,以提高屏幕上图像的颜色准确性,相较于基线取得了显著提升。
本文介绍了一种基于概念的可解释性框架,用于端到端自动驾驶模型。该框架通过稀疏自编码器进行无监督字典学习,将驾驶行为分解为人类可解释的概念。该框架能够分析和针对性修正模型决策,从而提升整体驾驶性能。
DiffSlack提出了一种可微投影层,通过将非线性不等式约束重新表述为带有可学习松弛变量的等式,在神经网络中强制执行这些约束,从而在车辆路径规划中实现了更高的可行性和规划成功率。
本文提出了一种端到端的基于Conformer的神经解码器,用于从一位肌萎缩侧索硬化症(ALS)参与者的皮层内记录进行语音解码,在没有任何外部语言模型的情况下,字符错误率达到23.80%。该研究表明,在完全端到端的框架中实现有意义的字符级解码是可行的。
作者提出了 Sub-JEPA,这是一种利用子空间高斯正则化来提高 LeWM 等端到端世界模型稳定性的方法,在连续控制基准测试中表现出一致的性能提升。
MoCapAnything V2 提出了一种面向任意骨骼单目视频动作捕捉的完全端到端框架,通过联合优化视频到姿态以及姿态到旋转的预测,解决旋转歧义性问题。