标签
MintAct 是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,在各种基准测试中达到了最先进的性能。
RSIAgent 是一个无需训练的多智能体框架,它使数字智能体能够通过递归自我改进、自主记忆构建和广度优先然后深度优先的探索来适应新环境,在基准测试中优于闭源模型。
文章认为,AI真正的转变不仅仅是生产力提升,而是从直接使用软件转向委托AI代表代为行事,这引发了关于数据亲密性和信任的问题。