标签
本文介绍了AHL Studio,这是一个使用智能体启发式学习的工具,无需传统训练即可创建用于人类活动识别的可执行、可检查策略,目标面向边缘部署。
该论文介绍了一种多智能体代理图学习框架(MAAGL),该框架将图划分为社区,并使用结构签名来改进图推理任务,性能优于最先进的方法。
Agent-G^2 引入了一个高斯指导框架,用于强化学习中的提示深度,提升了长期代理任务的性能,无需额外的探测回合,并在 ALFWorld 和 WebShop 基准测试中取得优异结果。
本文提出了一种基于扩展假说的框架,用于评估网络安全中的代理学习框架,无需标签基准,通过师生模型代理性能改进。
SERL-SQL提出了一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架,利用教师-学生似然差距对SQL动作token上的GRPO优势进行重新加权。该方法在BIRD和Spider基准上取得了强劲的结果。
本文研究了LLM代理是否可以通过交互推断隐藏的世界模型,发现随着复杂性的增加,它们难以构建稳定的内部模型。