VibeLifeBench:你的生活智能体能否在生活世界中主动且持续地行动?

Hugging Face Daily Papers 论文

摘要

介绍了VibeLifeBench,这是一个包含200个长周期任务、覆盖十个日常生活领域的基准测试,用于在模拟的多周生活世界中评估主动且持续的LLM智能体。当前前沿模型得分较低,凸显了现有智能体与现实生活辅助之间的差距。

大语言模型(LLM)智能体正越来越多地被部署为个人助理。然而,现有评估大多使用静态环境中的简短、独立请求。日常生活辅助则不同。一项任务会持续数周而非数分钟。在智能体未被提示时,世界也在不断变化。许多约束从未被明确说明。仅仅回答眼前请求的智能体会在这样的任务中失败。我们需要的是一种能够保持主动性和一致性的智能体。它自己决定何时行动、何时询问、何时保持沉默。它能注意到无人宣告的变化。它从第一天到最后一天都保持一个连贯的计划。目前没有任何基准测试能衡量这一点。我们推出了VibeLifeBench,这是一个包含200个长周期任务、覆盖十个日常生活领域的基准测试。每个任务都是在包含22个模拟服务的模拟世界中编写好的多周时间线。世界按自己的时钟推进,而且许多变化是无声的,因此只有重新检查世界的智能体才能发现它们。每个任务都通过细粒度、加权检查来评分,这些检查只读取智能体实际留下的痕迹,涵盖最终状态、行动的及时性,以及它是否遵守了隐含约束。我们评估了七个前沿模型。它们的得分都很低,这表明当前智能体距离辅助现实生活还有多远。我们将开源所有任务、环境和评估框架。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:21

论文页面 - VibeLifeBench:你的生活代理能在一个生活世界中保持主动和持久吗?

来源:https://huggingface.co/papers/2608.10875

摘要

一个新的基准测试 VibeLifeBench 评估了在模拟的数周日常任务中的长周期主动代理,结果显示当前前沿模型表现不佳。

大型语言模型(LLM)代理正越来越多地被部署为个人助理。然而,现有评估大多使用静态环境中的短小、自包含请求。日常生活辅助则不同:一项任务运行数周而非数分钟;世界在代理未被提示时不断变化;许多约束从未被明确说明。仅仅回答眼前请求的代理会在这类任务中失败。真正需要的是一种保持主动和一致的代理——它自行决定何时行动、何时询问、何时保持沉默;它能注意到无人宣告的变化;它让一个计划从第一天到最后一天保持连贯。目前没有基准能够衡量这一点。我们推出了 VibeLifeBench (https://huggingface.co/papers?q=VibeLifeBench),这是一个涵盖十个日常生活领域的 200 个长周期任务基准 (https://huggingface.co/papers?q=long-horizon%20tasks)。每个任务都是模拟世界中 22 个模拟服务 (https://huggingface.co/papers?q=mock%20services) 的脚本化多周时间线。世界按自己的时钟推进,许多变化是静默的,因此只有重新检查世界的代理才能发现它们。每个任务通过细粒度、加权的检查来评分,只读取代理实际留下的痕迹,涵盖最终状态、行动的及时性以及是否遵守隐含约束。我们评估了七个前沿模型 (https://huggingface.co/papers?q=frontier%20models)。它们得分都很低,这表明当前代理距离辅助真实生活还有多远。我们将开源所有任务、环境和评估框架 (https://huggingface.co/papers?q=evaluation%20framework)。

查看 arXiv 页面 (https://arxiv.org/abs/2608.10875)查看 PDF (https://arxiv.org/pdf/2608.10875)项目页面 (https://vibebench.github.io/VibeLifeBench_homepage/)GitHub6 (https://github.com/evolvent-ai/VibeLifeBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.10875)

在您的代理中获取这篇论文:

hf papers read 2608\.10875

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.10875 以从本页链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.10875 以从本页链接它。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.10875 以从本页链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

LifeSide:将 AI 智能体作为终身数字伴侣的基准测试

arXiv cs.CL

LifeSide 是一个用于评估 AI 智能体作为终身数字伴侣的新基准,涵盖记忆追踪、用户理解、隐私控制和情感陪伴四个维度,基于 2,000 个用户画像和 111K 个任务在多会话场景下进行测试。结果表明,即便是顶尖模型也难以在长期交互中保持准确的用户理解和真实的情感陪伴。

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。

WildClawBench:真实世界长周期智能体评估基准

Hugging Face Daily Papers

WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。