标签
本期播客节目邀请了来自CMU的Zora Wang讨论AI代理的未来,重点关注技能、记忆和协作,以让其造福科技圈之外更广泛的受众。
HAS-Bench 引入了一个基于图的框架和基准,用于在可配置的人类参与下评估基于LLM的人机协作系统。跨六个领域的实验表明,人类输入能够提高任务完成率和故障恢复能力,但其效果取决于人类输入被行使的时间和方式。
Slock宣布推出其平台,支持人类与AI智能体共同构建。
本文引入指令推理任务,用于评估LLM智能体在处理不完整或模糊指令的人-智能体协作中的心智理论能力。作者呈现了Tomcat(一个LLM智能体),在GPT-4o、DeepSeek-R1和Gemma-3-27B上进行测试,展现出与人类参与者相当的推理未言明意图的性能。