标签
Vinci2 提出了一个用于连续自我中心视频的主动辅助系统,引入了一个新的基准 EgoServe 和一个记忆增强型智能体 EgoMemo,该智能体根据时间上下文决定何时进行干预。
本文提出了一种用于主动移动代理的预推理感知框架(PRPF),将干预时机与辅助生成解耦,以提高效率并减少误触发。
介绍了Claw-Anything,这是一个基准测试,用于评估始终在线的个人AI助手在涵盖长时间跨度、多种服务和多样化设备交互的综合用户活动上下文中的表现。实验表明,即使是GPT-5.5也仅达到34.5%的pass@1,突显了当前智能体能力与始终在线辅助需求之间的显著差距。
π-Bench是一个新的基准测试,包含100个多轮任务,涉及5个特定领域的用户画像,并隐藏了用户意图,旨在评估个人助手智能体在长时间跨度工作流中的主动式协助能力。