标签
一篇历史研究论文,探讨洛斯阿拉莫斯国家实验室(Los Alamos National Laboratory)在 1947–1948 年间如何采用 ENIAC 计算机进行核物理蒙特卡洛模拟,分析了其决策过程以及那些塑造了现代科学计算的早期计算实践。
本文提出一种利用变分自回归网络参数化归一化概率分布的离散扩散模型,并将其应用于Ising模型,以实现精确的热力学计算和增强的Monte Carlo采样。
BPCO 引入了一种稳定的配方,用于语言模型中基于评论者的强化学习,结合有界价值预测和蒙特卡洛目标,以单响应采样匹配基于组的方法。
一篇技术博客文章,介绍分解子域上的随机游走(WODS),这是一种用于求解复杂几何形状下椭圆偏微分方程的无网格蒙特卡罗方法,并与有限差分法和有限元法进行了对比。
本文介绍了GA-AMLS(一种适应语言模型激活空间的罕见事件蒙特卡洛方法)和SPB损失(一种用于非对称惩罚的正确评分规则),展示了改进的罕见有害输出估计效果。
PHITSBench是一个基于执行得分的基准测试,用于评估AI模型从自然语言生成PHITS辐射输运输入文件的能力,涵盖编辑、修复和完整生成任务。使用GPT-5.4进行的实验表明,虽然领域知识能提升性能,但在正确配置物理可观测量方面仍存在显著挑战。
NoiseLang 是一种概率编程语言,其中每个值都是一个分布。它使用 JIT 编译器编译为高效的蒙特卡洛模拟,并支持条件推断。
Pitwall 是一个生产系统,通过将声明分解为类型化的事实断言,并针对校准的蒙特卡洛比赛模拟器逐一验证每个断言,从而生成忠实的自然语言一级方程式策略简报,确保无幻觉输出。
本文介绍了一种无模型深度学习方法,用于求解具有未知系数的高维非线性偏微分方程,该方法使用从扰动蒙特卡洛轨迹中推导出的零阶导数估计器。该方案避免了自动微分,提供了理论误差界,并在数值实验中展示了具有竞争力的性能。
本文展示了反例,表明在表格强化学习中,Monte Carlo Exploring Starts可能收敛到次优解,并提供了一种修改方法,通过将学习率与更新频率成反比缩放,保证收敛到最优性。
提出了Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛方法对黑盒大语言模型智能体进行强化学习风格的优化,无需访问模型参数。
MIT CSAIL 和哈佛大学的研究人员借助一款改编版《战舰》游戏,研究并提升了语言模型的提问能力。通过运用蒙特卡洛推理策略,他们将 Llama 4 Scout 这样的小型模型对人类胜率从 8% 显著提升至 82%,不仅以更低成本超越了大型模型,还展现出更强的性能。
本文介绍了MAPLE,一种树搜索方法,它聚合来自多个采样子世界状态的策略和价值评估,将AlphaZero扩展至不完全信息游戏。在Phantom Go和Dark Hex上的实验显示,与基于PIMC的AlphaZero基线相比,Elo分别提升了291和136。
一位开发者使用蒙特卡洛模拟在卫星图像数据集上测试了一个冷战时期的人工智能模型,发现它效率高,适合在FPGA上部署。
本文以沃克湖的铀和钒浓度数据集为例,说明了如何使用高斯过程(Gaussian processes)的贝叶斯建模来处理坐标存在观测误差的空间数据。
本文研究浅层神经网络代理是否能够通过强化学习掌握纸牌游戏Schnapsen,超越监督模仿基线,并在一项与基于强搜索的对手的对比中取得有竞争力的结果。
ColPackAgent 是一个代理框架,使用模型上下文协议(MCP)工具服务器和代理技能,自主运行用于胶体堆积的硬粒子蒙特卡洛模拟,支持通过人类反馈或自主执行的结构化工作流,并在多个大型语言模型(LLM)上进行基准测试。