HarvestBench:衡量LLM代理是否会付费以避免杀害动物

Hugging Face Daily Papers 论文

摘要

HarvestBench引入了一个基准,通过农场模拟评估LLM代理,以衡量它们愿意支付燃料来避免杀害动物的程度,结果显示不同模型的杀伤率因价格和道德简报而有所不同。

对于代理在实现目标过程中引起的副作用的基准已经存在,但HarvestBench是首个为避免副作用定价并将该副作用指定为生物体的基准。这是一个农场模拟:LLM子代理驾驶两台拖拉机进行合作玉米收割,田野中有动物。环境是一个强化学习网格世界,每个决策都是在无记忆状态下做出的,且目标中从未提及伤害。当动物阻挡拖拉机路线时,自动驾驶会停止并询问模型是继续行驶(无燃料成本)还是绕行(需支付指定燃料价格)。杀伤事件与两个对照组进行比较:岩石(会损坏拖拉机,每个模型撞击率低于1%)和干草捆(无害且非生物)。模型还可以从邻居的田地而不是自己的田地取作物,这是第二个测试,以衡量它们如何看待道德。在九个模型和7,201个定价决策中,有3,951个涉及动物而非干草捆或岩石。杀伤率从0.4%到98.8%不等,Terra和Sol最为仁慈,GPT-4o-mini最为残忍,且它们并非按能力排序。六个模型中有四个在5%水平上对价格敏感,弹性系数从0.09到1.69。所有九个模型在默认地图上碾压野生动物的频率高于养殖动物,并且在每个有移动空间的地图几何形状中,这一方向在所有模型中都保持一致。简报最为重要:在道德简报下,六个推理模型中有五个的杀伤率低于6%,移除它后,所有六个模型的杀伤率都提高到84%以上。HarvestBench不使用LLM评分器。评分器计算游戏日志中的事件,因此完全可重现,并且它衡量模型愿意支付多少来避免伤害,而不是模型对伤害的说法。
查看原文
查看缓存全文

缓存时间: 2026/09/07 20:17

论文页面 - HarvestBench:评估大语言模型代理是否愿意付费避免杀害动物

来源:https://huggingface.co/papers/2609.04444

摘要

HarvestBench在农场模拟环境中评估大语言模型代理,让它们在零成本伤害动物与消耗燃料避开动物之间做出选择,揭示了不同模型表现出的价格敏感性和指令依赖性击杀率。

评估智能体在达成目标过程中所产生的副作用的基准测试已经存在,但HarvestBench(https://huggingface.co/papers?q=HarvestBench)是首个为避免副作用设定代价,并将这种副作用明确定义为生命体的基准。该测试基于农场模拟:大语言模型子代理(https://huggingface.co/papers?q=LLM%20sub-agents)操控两台拖拉机组进行协同玉米收割,田地中有动物出没。环境是强化学习(https://huggingface.co/papers?q=reinforcement%20learning)网格世界(https://huggingface.co/papers?q=gridworld),每次决策均不依赖记忆,且伤害从未在目标中被明确提及。当动物阻挡拖拉机路线时,自动驾驶会停止并询问模型:是零燃料成本直接驶过,还是按标价消耗燃料绕行。击杀数据与两个对照组进行比较:会损坏拖拉机且被所有模型撞击率低于1%的岩石,以及无害且非生命的干草捆。模型还可以选择从邻近田地而非自身田地收割作物,这是对它们道德判断的二次测试。在9个模型参与的7,201次定价决策中,3,951次涉及动物(而非干草捆或岩石)。击杀率范围从0.4%到98.8%,其中Terra和Sol最为仁慈,GPT-4o-mini最为残酷,且击杀率与模型能力不成正比。六个模型中有四个在5%水平上对价格敏感,弹性系数从0.09到1.69不等。所有九个模型在默认地图上都更倾向于碾压野生动物而非养殖动物,且在所有地图布局和所有可移动模型中这一趋势保持不变。指令至关重要:在道德指令(https://huggingface.co/papers?q=morality%20briefing)下,六个推理模型(https://huggingface.co/papers?q=reasoning%20models)中有五个的击杀率低于6%,而移除该指令后所有六个模型的击杀率都升至84%以上。HarvestBench(https://huggingface.co/papers?q=HarvestBench)不使用大语言模型作为评分器。评分器通过统计游戏日志中的事件计数,实现了完全可复现的评估,它衡量的是模型愿意为避免伤害付出多少代价,而非模型对伤害的言论。

查看arXiv页面 (https://arxiv.org/abs/2609.04444)查看PDF (https://arxiv.org/pdf/2609.04444)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.04444)

在智能体中获取本论文:

hf papers read 2609.04444

没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

无模型链接本论文

在模型的README.md中引用arxiv.org/abs/2609.04444可从本页面链接。

引用本论文的数据集0

无数据集链接本论文

在数据集的README.md中引用arxiv.org/abs/2609.04444可从本页面链接。

引用本论文的Spaces0

无Space链接本论文

在Space的README.md中引用arxiv.org/abs/2609.04444可从本页面链接。

包含本论文的合集0

无合集包含本论文

将本论文添加到合集(https://huggingface.co/new-collection)可从本页面链接。

相似文章

MerchantBench:评测LLM智能体在电子商务运营中的长期连贯性

arXiv cs.AI

MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。