标签
本文基于AQuA预印本,讨论了代理循环中的固定评估器如何仍可能被代理适应所针对,并对验证反馈的隔离性提出疑问。
本文介绍了 AHD Agent,这是一个利用代理强化学习(Agentic Reinforcement Learning)的框架,使大型语言模型(LLMs)能够通过动态交互求解环境,自主地为组合优化问题设计启发式方法。