标签
本文提出了一种非参数变分学习框架,能够同步推断集体动力学中的相互作用核与环境力,并在基准模型上通过模型选择程序进行了验证。
本文介绍了扰动参数策略优化(3PO),这是一种用于LLM强化学习的参数空间探索方法族,展示了在数学和代码任务上相较于GRPO的一致改进。
提出非对称互变分学习(AMVL),通过双向校准防止答案泄露并提升潜在空间稳定性,解决多模态连续推理中的训练-推理不匹配问题,在BLINK基准测试上取得了显著的性能提升。
本文介绍了数据驱动变分基学习(DVBL),这是一种非神经网络框架,通过变分优化直接从数据中学习基函数,与神经网络相比,具有可解释性和数学透明性。