标签
本文提出了一种可学习的狄利克雷过程缓存,仅为新颖输入分配内存槽,使得缓存大小与独特项目数而非令牌数成比例,从而实现高效的关联回忆。它将DP-means聚类与循环骨干网络相结合,在关联回忆基准测试和真实世界数据流上展示了有效性。
本文提出了一种非参数贝叶斯逆强化学习方法,使用狄利克雷过程先验从专家演示中推断多个潜在奖励类型,并通过Ray实现并行的折叠吉布斯采样器以提高可扩展性。
介绍了神经贝叶斯顺序路由(NBSR),这是一个将神经推理建模为有向无环图(DAG)上的顺序证据积累的框架,使用狄利克雷-分类共轭更新,实现了不确定性量化、早期退出和资源理性推理。