VibeLifeBench:你的生活智能体能否在生活世界中主动且持续地行动?
摘要
介绍了VibeLifeBench,这是一个包含200个长周期任务、覆盖十个日常生活领域的基准测试,用于在模拟的多周生活世界中评估主动且持续的LLM智能体。当前前沿模型得分较低,凸显了现有智能体与现实生活辅助之间的差距。
查看缓存全文
缓存时间: 2026/08/12 08:21
论文页面 - VibeLifeBench:你的生活代理能在一个生活世界中保持主动和持久吗?
来源:https://huggingface.co/papers/2608.10875
摘要
一个新的基准测试 VibeLifeBench 评估了在模拟的数周日常任务中的长周期主动代理,结果显示当前前沿模型表现不佳。
大型语言模型(LLM)代理正越来越多地被部署为个人助理。然而,现有评估大多使用静态环境中的短小、自包含请求。日常生活辅助则不同:一项任务运行数周而非数分钟;世界在代理未被提示时不断变化;许多约束从未被明确说明。仅仅回答眼前请求的代理会在这类任务中失败。真正需要的是一种保持主动和一致的代理——它自行决定何时行动、何时询问、何时保持沉默;它能注意到无人宣告的变化;它让一个计划从第一天到最后一天保持连贯。目前没有基准能够衡量这一点。我们推出了 VibeLifeBench (https://huggingface.co/papers?q=VibeLifeBench),这是一个涵盖十个日常生活领域的 200 个长周期任务基准 (https://huggingface.co/papers?q=long-horizon%20tasks)。每个任务都是模拟世界中 22 个模拟服务 (https://huggingface.co/papers?q=mock%20services) 的脚本化多周时间线。世界按自己的时钟推进,许多变化是静默的,因此只有重新检查世界的代理才能发现它们。每个任务通过细粒度、加权的检查来评分,只读取代理实际留下的痕迹,涵盖最终状态、行动的及时性以及是否遵守隐含约束。我们评估了七个前沿模型 (https://huggingface.co/papers?q=frontier%20models)。它们得分都很低,这表明当前代理距离辅助真实生活还有多远。我们将开源所有任务、环境和评估框架 (https://huggingface.co/papers?q=evaluation%20framework)。
查看 arXiv 页面 (https://arxiv.org/abs/2608.10875)查看 PDF (https://arxiv.org/pdf/2608.10875)项目页面 (https://vibebench.github.io/VibeLifeBench_homepage/)GitHub6 (https://github.com/evolvent-ai/VibeLifeBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.10875)
在您的代理中获取这篇论文:
hf papers read 2608\.10875
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.10875 以从本页链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.10875 以从本页链接它。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.10875 以从本页链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
LifeSide:将 AI 智能体作为终身数字伴侣的基准测试
LifeSide 是一个用于评估 AI 智能体作为终身数字伴侣的新基准,涵盖记忆追踪、用户理解、隐私控制和情感陪伴四个维度,基于 2,000 个用户画像和 111K 个任务在多会话场景下进行测试。结果表明,即便是顶尖模型也难以在长期交互中保持准确的用户理解和真实的情感陪伴。
HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
WildClawBench:真实世界长周期智能体评估基准
WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。