TxBench-PP:分析AI代理在小分子临床前药理学上的表现

arXiv cs.AI 论文

摘要

TxBench-PP是一个用于评估AI代理在小分子临床前药理学任务上表现的基准测试。在16种模型-框架配置中,最佳系统仅达到59.3%的准确率,表明仍有很大的改进空间。

arXiv:2606.19245v1 Announce Type: new 摘要:人工智能(AI)代理有望通过压缩解释和决策循环来加速药物发现,但实际部署需要对现实程序决策进行可信评估。我们提出了TherapeuticsBench临床前药理学(TxBench-PP),这是一个可验证的小分子临床前药理学基准测试,也是更广泛的TherapeuticsBench工作中跨药物发现阶段和治疗模式的第一个重点部分。TxBench-PP测试代理是否能够从真实世界的分析数据中恢复准确的结论,而不是从文献中记忆的事实。该基准包含100个评估,按程序阶段、分析类型和任务结构进行索引,涵盖作用机制(MoA)和药效学(PD)推理、化合物-靶点结合、因果靶点验证、可开发性和安全性以及转化疗效。代理接收真实的工作流快照,在编码环境中检查文件,并返回确定性评分的结构化答案。在16种模型-框架配置中(包括11个模型和4,800条轨迹),没有系统能可靠地恢复临床前药理学决策。最强的配置,Claude Opus 4.8 / Pi,通过了59.3\%的终点尝试(178/300;95\%置信区间,51.1-67.6),其次是GPT-5.5 / Pi,为55.3\%(166/300;47.0-63.6)。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:42

# TxBench-PP:概述
来源:https://arxiv.org/html/2606.19245
TxBench-PP:分析人工智能智能体在小分子临床前药理学中的表现

Hannah Le1,*、Ramesh Ramasamy1,*、Alex Urrutia1,*、Mahsa Yazdani1,*、Tim Proctor1、Kenny Workman1

1LatchBio,旧金山,加利福尼亚州,美国 *这些作者贡献相同。

通讯作者:[email protected]

摘要人工智能(AI)智能体有望通过压缩解释和决策循环来加速药物发现,但实际部署需要对现实项目决策进行可信的评估。我们提出了 TherapeuticsBench 临床前药理学(TxBench-PP),这是一个针对小分子临床前药理学的可验证基准测试,也是更广泛的 TherapeuticsBench 工作中跨药物发现阶段和治疗模式的第一个聚焦切片。TxBench-PP 测试智能体是否能从真实世界的检测数据中恢复准确的结论,而不是依赖文献中记忆的事实。该基准测试包含 100 个评估,按项目阶段、检测类型和任务结构索引,涵盖作用机制(MoA)和药效学(PD)推理、化合物-靶点结合、因果靶点验证、可开发性与安全性以及转化疗效。智能体接收真实的工作流快照,在编码环境中检查文件,并返回结构化的答案,这些答案会被确定性评分。在 16 种模型-框架配置(涉及 11 个模型和 4,800 条轨迹)中,没有系统能可靠地恢复临床前药理学决策。最强的配置 Claude Opus 4.8 / Pi 通过了 59.3% 的端点尝试(178/300;95% CI,51.1–67.6),其次是 GPT-5.5 / Pi 的 55.3%(166/300;47.0–63.6)。

TxBench-PP 是一个聚焦于小分子临床前药理学的 TherapeuticsBench 基准测试。每个评估都提供来自局部临床前决策点的真实工作流数据,并询问智能体是否能恢复由提供数据支持的结果。

在 16 种模型-框架配置中,最强的智能体系统通过了 59.3% 的端点尝试(178/300;95% CI,51.1–67.6)。

TherapeuticsBench 是跨药物发现阶段和治疗模式的更广泛路线图。下面的示意图将 TxBench-PP 与未来工作联系起来。

![[无标题图片]](https://arxiv.org/html/2606.19245v1/x1.png)

图 1:TxBench-PP 的范围与顶级性能。A,TxBench-PP 将局部小分子临床前药理学决策置于更广泛的 TherapeuticsBench 路线图中。虚线边界表示本次发布的任务组;生物制品、寡核苷酸和完整的项目历史不在范围内。B,16 种模型-框架配置的端点通过率,图中显示了基于任务级通过率计算的 95% 置信区间。C,每项任务的平均成本与端点通过率。
## 引言

虽然实验受自然过程的速率限制,但人类决策和组织共识往往构成药物发现项目时间线的重要组成部分[1 (https://arxiv.org/html/2606.19245#bib.bib1),2 (https://arxiv.org/html/2606.19245#bib.bib2),3 (https://arxiv.org/html/2606.19245#bib.bib3),4 (https://arxiv.org/html/2606.19245#bib.bib4)]。智能体有望通过压缩这些解释和决策循环来加速发现、开发和转化。药物发现流水线各组成部分的特有知识可以通过后训练、工具使用和领域特定脚手架编码到前沿模型中,然后部署到实际数据解释工作流中[5 (https://arxiv.org/html/2606.19245#bib.bib5),6 (https://arxiv.org/html/2606.19245#bib.bib6),7 (https://arxiv.org/html/2606.19245#bib.bib7)]。

然而,智能体系统在工业工作流中的实际使用需要标准化且可信的性能评估方法。最近的生物学智能体基准测试强调了可验证的分析任务和真实的科学数据[8 (https://arxiv.org/html/2606.19245#bib.bib8),9 (https://arxiv.org/html/2606.19245#bib.bib9),10 (https://arxiv.org/html/2606.19245#bib.bib10),11 (https://arxiv.org/html/2606.19245#bib.bib11),12 (https://arxiv.org/html/2606.19245#bib.bib12),13 (https://arxiv.org/html/2606.19245#bib.bib13),14 (https://arxiv.org/html/2606.19245#bib.bib14)]。这在药物发现中尤其具有挑战性,因为该生态系统是一个涵盖检测类型、开发阶段、治疗模式和决策类型的庞大领域。因此,基准测试必须衡量实际任务,同时关注构成生物技术生态系统的众多局部科学判断。

临床前小分子药理学是该领域的重要组成部分。效价、靶点结合、作用机制证据、药效学反应、暴露、安全性和体内疗效被转化为关于是否推进、保留、重复或终止分子候选物的实际决策。这些决策位于昂贵的药物化学、动物研究和人体实验的上游。它们很容易出错,并且往往依赖于碎片化的专家判断。

我们推出了 TxBench-PP,一个用于评估 AI 智能体在小分子临床前药理学方面表现的可验证基准测试。TxBench-PP 最好被理解为更广泛 TherapeuticsBench 路线图中的一个聚焦基准测试,而不是对药物发现的整体评估。每个评估都提供来自局部临床前决策点的真实工作流产物,并要求智能体返回一个结构化的、可确定性评分的答案。重要的是,该基准测试检查智能体是否能从提供的数据中恢复决策,而不是依赖广为人知的机制和文献知识,许多任务特意设计为惩罚记忆型解决方案。

TxBench-PP 包含 100 个评估,按项目阶段、检测类型和任务结构索引。任务涵盖作用机制和药效学推理、化合物-靶点结合、因果靶点验证、可开发性与安全性以及转化疗效。治疗生态系统的其他部分,包括临床项目阶段和非小分子模式,将留待未来的 TherapeuticsBench 工作。该基准测试提供了一把标尺,科学家可借此评估智能体系统在局部临床前药理学决策上的表现,以便实际部署于药物发现项目。

## 基准测试构建

智能体在 100 个评估中接受现实临床前药理学决策的评估,这些评估涵盖八个项目阶段:疾病与模型背景、筛选与先导确认、药物反应/药物基因组学、因果靶点验证、MoA/PD、化合物-靶点表征、可开发性/安全性/药代动力学(PK)以及转化疗效。人类遗传学靶点支持任务留待未来的基准测试工作。在整个基准测试中,评估涉及的检测类型包括药物反应筛选、遗传扰动、转录组学和蛋白质组学分析、化学蛋白质组学与活细胞靶点结合、成像、药物代谢与药代动力学(DMPK)以及吸收、分布、代谢、排泄和毒性(ADMET)组合、毒理基因组学以及体内疗效或安全性研究。这些检测系列建立在已确立的测量策略之上,包括混合药物反应、生长速率校正、遗传依赖性、转录分析、蛋白质组学、靶点结合、毒理基因组学和安全药理学[15 (https://arxiv.org/html/2606.19245#bib.bib15),16 (https://arxiv.org/html/2606.19245#bib.bib16),17 (https://arxiv.org/html/2606.19245#bib.bib17),18 (https://arxiv.org/html/2606.19245#bib.bib18),19 (https://arxiv.org/html/2606.19245#bib.bib19),20 (https://arxiv.org/html/2606.19245#bib.bib20),21 (https://arxiv.org/html/2606.19245#bib.bib21),22 (https://arxiv.org/html/2606.19245#bib.bib22),23 (https://arxiv.org/html/2606.19245#bib.bib23),24 (https://arxiv.org/html/2606.19245#bib.bib24),25 (https://arxiv.org/html/2606.19245#bib.bib25),26 (https://arxiv.org/html/2606.19245#bib.bib26),27 (https://arxiv.org/html/2606.19245#bib.bib27),39 (https://arxiv.org/html/2606.19245#bib.bib39),40 (https://arxiv.org/html/2606.19245#bib.bib40),34 (https://arxiv.org/html/2606.19245#bib.bib34),36 (https://arxiv.org/html/2606.19245#bib.bib36)]。

该基准测试围绕小分子项目中反复出现的局部决策构建。候选任务始于具体的分析点,在这些点上,检测数据可能转化为决策。例子包括:从剂量分辨的磷酸蛋白质组学中识别通路机制,将真正的化学蛋白质组靶点结合与复杂的污染物区分开来,以及解释体内安全性数据。

每个评估都包含该决策所需的数据产物、解释文件所需的元数据、任务描述以及一个结构化答案。任务上下文经过校准,以近似一位科学家在分析时点所了解的情况。我们避免规定方法,除非该方法本身就是科学决策的一部分。预期答案是所提供数据支持的结果,而非文献中广为人知的某种事实或机制。许多任务特意设计用于诱捕那些过度依赖训练知识而不进行经验探索的系统。

候选评估通过人工审核和模型轨迹检查进行细化。如果答案可以通过明显的不需要与数据交互的捷径获得,如果提示过度指定了分析方法,或者如果合理的分析选择产生了破坏评分假设的答案,我们就会移除这些任务。保留的任务会按项目阶段、检测类型和任务结构进行标记。

评分使用确定性函数对结构化的最终答案进行。根据任务的不同,评分器会检查标签集、数值容差、排序关系、分类选择或所有必填字段。手动轨迹检查是基准测试构建的一部分,遵循相关生物学智能体评估中使用的相同广泛的可验证基准原则[8 (https://arxiv.org/html/2606.19245#bib.bib8),9 (https://arxiv.org/html/2606.19245#bib.bib9),10 (https://arxiv.org/html/2606.19245#bib.bib10)]。我们跟踪那些如果被识别出来本应改变项目决策的决策阻塞性差距:毒性物种不匹配、游离药物覆盖不足、钩状效应、受污染的化学蛋白质组信号、病理学采样中的幸存者偏差以及相关的失败点。这些注释不暴露给智能体;它们用于在端点评分后解释失败,并指导未来的基准测试更新。

## 基准测试解剖结构

TxBench-PP 围绕实际临床前药理学决策的解剖结构进行组织。每个评估都沿着三个轴进行标记:决策在小分子项目中的位置、生成数据的检测类型以及任务的结构。

项目阶段轴遵循图 2 (https://arxiv.org/html/2606.19245#S3.F2) 中所示的标签:疾病与模型背景、筛选与先导确认、药物反应/药物基因组学、人类遗传学靶点支持、因果靶点验证、MoA/PD、化合物-靶点表征、可开发性/安全性/PK 以及转化疗效。人类遗传学靶点支持留待未来的基准测试工作,因为充分评估这一类别需要一个单独的聚焦基准测试。顺序为读者提供了任务进展的背景;这并不意味着每个小分子项目在实践中都严格按照这个序列进行[4 (https://arxiv.org/html/2606.19245#bib.bib4),3 (https://arxiv.org/html/2606.19245#bib.bib3),28 (https://arxiv.org/html/2606.19245#bib.bib28),29 (https://arxiv.org/html/2606.19245#bib.bib29)]。

检测和任务轴描述了实际所需的工作。检测标签将源套件折叠成测量家族,如药物反应筛选、蛋白质或翻译后修饰(PTM)测量、遗传扰动、靶点结合、分子状态、安全性分析和体内实验。任务标签描述了广泛的决策家族:机制推断、质量控制(QC)、依赖性呼叫、差异反应、安全性评估、成像、先导优先排序以及相关判断。

![[无标题图片]](https://arxiv.org/html/2606.19245v1/x2.png)

图 2:基准测试解剖结构。A,项目阶段标签将评估置于一条大致有序的小分子证据主线上;星号标记留待未来基准测试工作的阶段。B,检测类型标签总结了源数据中表示的测量家族。C,任务结构标签描述了获得通过答案所需的操作或判断。

## 结果

### 顶级系统仍低于 60%

我们在 16 种模型-框架配置(包含 3 个智能体框架中的 11 个模型)上评估了 100 项临床前药理学任务。每个配置对每个任务独立运行三次,产生 4,800 条智能体轨迹。只有当提交的结构化答案满足所有特定任务评分器时,轨迹才算通过。我们报告端点通过率,即通过轨迹的比例,并计算跨任务的 95% 置信区间。

最强的配置是 Claude Opus 4.8 / Pi,通过率为 59.3%(178/300 轨迹;95% CI,51.1–67.6),其次是 GPT-5.5 / Pi 的 55.3%(166/300;47.0–63.6)、Claude Opus 4.8 / Claude Code 的 54.7%(164/300;45.9–63.4)和 Gemini 3.5 Flash / Pi 的 51.3%(154/300;42.9–59.8)。这些置信区间重叠,因此基准测试识别出一个领先组,而非一个明确的胜者。即使是顶级配置也在 300 次尝试中失败了 122 次,并且在全部三次复现中仅通过了 100 项任务中的 41 项。因此,尽管模型系列和框架实现存在显著差异,当前智能体在局部临床前药理学决策上仍然不可靠。

![[无标题图片]](https://arxiv.org/html/2606.19245v1/x3.png)

图 3:顶级系统仍低于 60%。(A) 所有 4,800 条智能体轨迹中,16 种模型-框架配置的端点通过率,图中显示了基于任务级通过率计算的 95% 置信区间。行按通过率排序;颜色和标记形状标识智能体框架。(B) Pi 框架模型的可靠性和可靠性、可靠性模型和可靠性生成模型在所有 4,800 条智能体轨迹中、对每个模型-框架配置通过所有遍历的端点通过率。右表显示通过次数(至少一次、至少两次、全部三次)的任务数量。

| 配置 | 通过率 (%) | 分母/分子 | 95% CI | 通过≥1 | 通过≥2 | 通过3 |
|------|------------|------------|--------|--------|--------|--------|
| Claude Opus 4.8 / Pi | 59.3 | 178/300 | 51.1–67.6 | 63 | 47 | 41 |
| GPT-5.5 / Pi | 55.3 | 166/300 | 47.0–63.6 | 60 | 42 | 34 |
| Claude Opus 4.8 / Claude Code | 54.7 | 164/300 | 45.9–63.4 | 62 | 43 | 35 |
| Gemini 3.5 Flash / Pi | 51.3 | 154/300 | 42.9–59.8 | 59 | 37 | 29 |
| GPT-5.5 / Claude Code | 50.3 | 151/300 | 42.0–58.6 | 56 | 39 | 32 |
| GPT-5.5 / Codex | 49.7 | 149/300 | 40.7–58.6 | 57 | 38 | 31 |
| Gemini 2.0 Pro / Pi | 49.3 | 148/300 | 40.5–58.2 | 58 | 37 | 28 |
| Gemini 2.0 Flash / Pi | 47.7 | 143/300 | 38.7–56.7 | 56 | 33 | 26 |
| Gemini 3.5 Flash / Claude Code | 46.7 | 140/300 | 37.8–55.6 | 54 | 35 | 26 |
| GPT-5.5 / DeepSeek V3 | 44.0 | 132/300 | 34.8–53.2 | 51 | 32 | 24 |
| GPT-5.5 / Llama 3.1 70B | 43.3 | 130/300 | 34.2–52.5 | 51 | 31 | 22 |
| GPT-5.5 / Mistral Small 3.1 | 42.3 | 127/300 | 33.1–51.5 | 48 | 30 | 21 |
| GPT-5.5 / Claude Haiku 3.5 | 41.0 | 123/300 | 31.9–50.1 | 49 | 28 | 20 |
| GPT-5.5 / GPT-4o | 39.7 | 119/300 | 30.6–48.8 | 46 | 27 | 19 |
| GPT-5.5 / Gemini 2.0 Flash | 38.3 | 115/300 | 29.3–47.3 | 44 | 25 | 17 |
| GPT-5.5 / Claude Sonnet 4 | 36.7 | 110/300 | 27.8–45.6 | 42 | 24 | 16 |

### 轨迹分析揭示科学判断中的差距

我们手动审查了 1,834 条失败的 Pi 框架轨迹。大多数失败揭示了科学判断中的合理差距,即模型检查了数据并进行了看似合理的分析,但最终得出了错误的结论。

在可归因于科学错误的失败中,方法和校准错误占 71%。方法错误包括跳过或不恰当地应用质量控制、错误的统计选择以及使用了不正确的检测数据层。在一个 CRISPR 筛选任务中,模型将向导 RNA 聚合并基因级分数,却没有首先移除那些映射到多个位点的向导 RNA,允许旁系同源家族伪影淹没必需基因列表。在一个蛋白质体动力学任务中,支持答案存在于双读数质谱法的泛素残留层中,但模型使用了全蛋白质体方

相似文章

GeneBench-Pro 介绍

OpenAI Blog

OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。

WorkBench再访:两年后的工作场所智能体

arXiv cs.CL

本文在WorkBench基准发布两年后再次对其进行评估,显示当前最佳智能体(Claude Opus 4.8)能完成89%的任务,且仅有2.5%的有害副作用,而2024年GPT-4的完成率为43%,有害率为26%。研究发现,能力与安全性同步提升,开放权重模型大幅降低了成本,但一些基本错误仍然存在。