AI原生生物技术公司是否需要部门?为AI驱动药物开发的公司世界模型基准测试

arXiv cs.AI 论文

摘要

本文认为,AI原生生物技术公司应使用一种称为公司世界模型(Company World Model)的核心计算抽象,而非模仿人类部门结构。文章引入了一个干实验基准来比较不同架构,发现价值转换架构(value-conversion architecture)优于人类组织模仿,但结果对目标敏感。

arXiv:2607.18696v1 公告类型: 新 摘要:AI原生生物技术公司通常通过将人类生物技术组织架构图复制到智能体角色中来进行设计。我们主张采用不同的抽象方法:公司世界模型(Company World Model),定义为一种持久的资产到价值状态表示,包含转移模型、显式价值函数、规划以及跨科学、监管、商务拓展、商业、财务和执行约束的更新。我们引入了一个干实验基准,用于测试AI智能体组织是否应模仿部门结构,还是围绕此类世界模型运行。该基准包含45个回顾性公开信息决策案例,具有严格的时间截断、隐藏结果、通用模式、自动评分和盲法配对评判。我们比较了人类组织模仿、强化版人类组织模仿、AI原生资产中心以及AI原生价值转换架构。价值转换架构是公司世界模型的提示级别近似:一个实时资产价值记录(Live Asset Value Record),由交易、批准、收入和投资仲裁循环(Deal, Approval, Revenue, and Investment Arbiter loops)更新。在由外部BD、监管批准与上市以及收入纪律定义的成功函数下,它获得了最高的自动价值转换得分,并且被价值特定盲法评判者强烈偏好于原始基线。压力测试缩小了这一结论:一个更强的人类基线仍然具有竞争力,而中性评判者未显示出稳健的价值转换优势。仅Codex的机制消融表明,在目标目标下,收入室(Revenue Room)、交易室(Deal Room)和批准室(Approval Room)承担了有用工作。核心发现对目标敏感:部门可能仍是有用的治理视角,但核心的AI原生操作原语应是一个共享的、预测性的资产到价值状态,而非静态的人类组织架构图。本研究仅为干实验,不涉及真实世界的药物成功、临床效益或收入预测准确性。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:22

# 原生AI生物技术公司需要部门吗?——面向AI驱动药物开发的公司世界模型基准测试
来源:https://arxiv.org/html/2607.18696
###### 摘要

原生AI生物技术公司通常通过将人类生物技术公司的组织架构图复制到智能体角色中来设计:生物学、临床开发、注册事务、生产制造、业务拓展、商业化、项目管理以及投资委员会。我们认为,作为核心计算抽象,这种做法是不完整的。最近关于世界模型的研究将有能力的智能体定义为能够维护预测性状态表征、模拟基于行动的未来情境、并在观测与预期不符时修正这些模型的系统。将这一理念转化到生物制药领域,我们定义了一个**公司世界模型**:一个持久、可审计的模型,涵盖资产状态、证据、不确定性、注册路径、合作伙伴/买家需求、商业潜力、资源,以及候选行动对企业价值的预期影响。我们引入了一个干实验基准,用于测试AI智能体组织是应该模仿部门运作,还是围绕这样一个从资产到价值的世界模型来运作。该基准包含45个回顾性公共信息决策案例,这些案例设有严格的时间截点、隐藏的结果、通用的输出模式、自动评分以及盲测成对评判。我们比较了人类组织模仿、更强的人类组织模仿增强版、原生AI以资产为中心、以及原生AI价值转化四种架构。价值转化架构是对公司世界模型的一种提示层面的近似:由一个交易、审批、营收和投资仲裁循环来更新实时资产价值记录。在由对外业务拓展、注册审批与上市以及营收纪律定义的成功函数下,该架构在原始三个分支中取得了最高的自动评分(4.68,而人类组织模仿为4.33,以资产为中心的原生AI为4.26),并且在价值特定盲测评判员中显著优于原始基线。压力测试缩小了这一主张:更强的人类基线提升至4.49,价值转化原生AI仅在Codex价值特定评判中方向性胜出(26-19),而中立的决策质量评判员略微偏好人类组织模仿增强版(25-20)。机制消融实验与但不证明世界模型的解释一致:完整架构优于没有营收空间(44-1)、交易空间(41-4)、审批空间(35-10)和投资仲裁(27-18)的版本。核心发现对目标函数敏感:原生AI生物制药公司应公开其世界模型所优化的目标函数。部门可能仍然是有效的治理视图,但核心运作原语应是一个共享的、预测性的从资产到价值的状态,而非静态的人类组织架构图。本研究仅为干实验,并未确立真实的药物成功或营收预测准确性。

## 1 引言

生物制药不仅是一个科学发现问题,它还是一个不确定性条件下的序列决策问题。一家公司必须决定追求哪些靶点、资助哪些资产、什么样的证据会改变信念、何时停止开发、何时合作、何种证据足以满足监管要求,以及产品上市后能否具有商业意义。人类生物技术和制药公司通常通过将工作划分为不同职能来解决这个问题:生物学、转化科学、临床开发、注册事务、化学/制造/控制、商业化、业务拓展、财务、项目管理以及投资委员会治理。

这种结构的存在有其合理原因。人类拥有有限的上下文窗口、有限的工作记忆、有限的带宽以及专业化的训练。部门将认知和责任分散到不同的人身上。原生AI组织则有不同的约束。AI智能体可以从共享状态对象出发,检索长历史记录,动态调用工具,生成专门的子程序,并将科学、监管、商业和财务证据综合到同一个决策状态中。如果这些能力是真实的,那么复制人类组织架构图可能是一个糟糕的默认设计原则。

最近的世界模型研究为这个问题提供了更好的语言。世界模型智能体维护环境状态的内部表征,预测状态在行动下如何变化,在可能的未来上进行规划,并在新观测与先前预期相矛盾时更新模型[1 (https://arxiv.org/html/2607.18696#bib.bib1),2 (https://arxiv.org/html/2607.18696#bib.bib2),3 (https://arxiv.org/html/2607.18696#bib.bib3),4 (https://arxiv.org/html/2607.18696#bib.bib4)]。在物理AI中,状态可能是一个场景,行动可能是机器人运动。在原生AI生物制药公司中,状态是资产和公司价值背景:生物学主张、证据强度、不确定性、知识产权状况、竞争格局、注册路径、合作伙伴需求、患者和支付方逻辑、上市假设、资本约束以及执行选项。行动包括实验、试验设计、监管互动、业务拓展外联、适应症选择、证据包变更、融资选择以及终止或合作决策。

我们将这种抽象称为**公司世界模型**。它不是仪表盘,也不仅仅是知识图谱。它是一个持久、可审计的状态与转换模型,它询问:在当前资产状态下,哪种行动最有可能提高对外业务拓展、注册审批与上市以及预期营收的概率,同时受时间、资本、证据和竞争约束?在这种框架下,核心组织原语不再是部门,而是智能体在其上进行模拟、质疑、执行和更新的实时从资产到价值的状态。

本文提出了一个直接的问题:原生AI生物技术公司需要部门吗?还是应该围绕公司世界模型来组织?我们在干实验室中研究这个问题。我们不进行实验、不设计新分子、也不声称AI系统可以替代真实的临床开发。相反,我们构建了一个回顾性决策基准。每个案例要求一个AI智能体组织根据指定截点之前可用的公共资源做出一个基于历史事实的生物制药决策。模型看不到后续结果。相同的案例提示、资源集、输出模式和评估框架用于所有架构。这使得我们可以改变一个设计变量:智能体的组织方式。

最初的假设是,原生AI以资产为中心的架构应该优于人类组织模仿架构,因为它围绕单个实时资产记录来组织工作,而不是一串类似部门的备忘录。早期实验部分支持了这一假设:以资产为中心的架构在失败和模糊的临床案例中改进了风险识别和可操作性。但它暴露了一个差距。一个药物项目仅凭一份推理充分的科学记录并不能成功。在实践中,一个成功的资产必须转化为对外业务拓展价值、注册审批与上市以及预期的销售额。

因此,我们测试了第三种架构:原生AI价值转化组织。这一设计是我们对公司世界模型的第一个提示层面近似。一个实时资产价值记录代表了当前状态。交易、审批和营收循环模拟行动如何改变合作伙伴兴趣、监管可行性、标签质量、支付方准入、市场采纳和预测质量。一个投资仲裁器作为规划者作用于共享状态,识别约束瓶颈,并推荐执行、终止、观望或合作(图1 (https://arxiv.org/html/2607.18696#S1.F1))。

图1:该基准比较了一种人类组织模仿架构,其中功能型智能体在委员会综合之前生成类似部门的备忘录,与一种公司世界模型架构,其中智能体作用于一个共享的从资产到价值的状态,模拟特定目标的转换,并通过规划层选择下一个行动。

第一个价值转化结果很强,但持怀疑态度的审稿人会问这是否是循环论证:我们设计了一个价值转化架构,然后用价值转化评分标准来评估它?因此,我们增加了一个更强的人类基线、一个中立的评判员提示以及机制消融实验。这些测试改变了解释。目前最好的主张不是价值转化原生AI普遍更好。最好的主张是,原生AI组织必须公开其世界模型正在优化的目标函数,并且部门复制并非唯一可行的基线。

本文贡献如下:

1. 1. 一个用于在高风险科学商业领域评估AI智能体组织设计的基准框架;
2. 2. 针对原生AI生物制药的公司世界模型抽象:共享的从资产到价值的状态、转换模型、目标函数和规划器;
3. 3. 一个包含45个回顾性生物制药决策数据集,设有时间截点、隐藏结果、通用模式和资源约束;
4. 4. 匹配的智能体组织架构:人类组织模仿、人类组织模仿增强版、原生AI以资产为中心、原生AI价值转化/公司世界模型;
5. 5. 自动评估和盲测成对评判显示,价值转化组织在BD/审批/营收目标下有所帮助,但在中立评判下并未稳健胜出;
6. 6. 机制消融实验测试哪些价值转化循环驱动了完整架构在目标目标下的优势。

## 2 相关工作

#### LLM智能体与智能体架构。

近期关于语言模型智能体的工作表明,模型可以被嵌入到具有记忆、规划、工具使用、反思和迭代执行能力的系统中。Generative Agents引入了一种模拟智能体架构,具有记忆检索、反思、规划和社交互动能力[5 (https://arxiv.org/html/2607.18696#bib.bib5)]。Voyager展示了一个开放式的具身智能体,能够累积可重用的技能并利用环境反馈[6 (https://arxiv.org/html/2607.18696#bib.bib6)]。ReAct、Reflexion、Tree of Thoughts、HuggingGPT、AgentBench、AgentBoard和SWE-bench进一步说明,智能体性能取决于分解、工具使用、执行环境和评估设计[7 (https://arxiv.org/html/2607.18696#bib.bib7),8 (https://arxiv.org/html/2607.18696#bib.bib8),9 (https://arxiv.org/html/2607.18696#bib.bib9),10 (https://arxiv.org/html/2607.18696#bib.bib10),11 (https://arxiv.org/html/2607.18696#bib.bib11),12 (https://arxiv.org/html/2607.18696#bib.bib12),13 (https://arxiv.org/html/2607.18696#bib.bib13)]。我们的研究将这一系统性问题应用于组织设计。

#### 用于智能体规划的世界模型。

世界模型最初作为学习到的内部模型出现,允许智能体在环境动态的压缩表示内进行规划或学习策略[1 (https://arxiv.org/html/2607.18696#bib.bib1)]。近期工作将该理念从强化学习环境扩展到基础世界模型和可行动控制的交互环境[2 (https://arxiv.org/html/2607.18696#bib.bib2)]。V-JEPA 2将世界模型定义为支持物理世界中理解、预测和规划的自监督系统[3 (https://arxiv.org/html/2607.18696#bib.bib3)]。智能体世界建模进一步提出一个按层级和法则的分类法,其中世界模型可以是预测器、模拟器或自我更新的进化器,适用于物理、数字、社会和科学领域[4 (https://arxiv.org/html/2607.18696#bib.bib4)]。我们使用的“公司世界模型”是这一状态-转换-规划视角的领域翻译。一家生物制药公司不需要预测像素;它需要预测行动如何改变证据、监管可行性、业务拓展需求、商业潜力、执行风险和不确定性下的价值。

#### 用于科学与化学发现的AI。

自主科学系统如Coscientist已经表明,基于LLM的智能体在连接到工具和实验基础设施时,可以规划和执行化学研究工作流程[14 (https://arxiv.org/html/2607.18696#bib.bib14)]。AlphaFold和其他科学AI系统展示了机器学习在生物医学发现中的更广泛价值[15 (https://arxiv.org/html/2607.18696#bib.bib15)]。AI科学家探索了自动化的科学构思、实验执行、论文撰写和评审[16 (https://arxiv.org/html/2607.18696#bib.bib16)]。这些工作主要关注假设生成、实验、方案或科学产出。我们的基准则聚焦于干实验层面的公司和资产决策。

#### 基准与LLM即评判员评估。

大规模基准工作如BIG-bench和HELM强调了跨任务和模型的标准化、透明化评估[17 (https://arxiv.org/html/2607.18696#bib.bib17),18 (https://arxiv.org/html/2607.18696#bib.bib18)]。LLM即评判员方法如MT-Bench和G-Eval提供了可扩展的偏好评估,但引入了提示、风格和模型偏差的风险[19 (https://arxiv.org/html/2607.18696#bib.bib19),20 (https://arxiv.org/html/2607.18696#bib.bib20)]。生物医学基准如PubMedQA、MedQA和Med-PaLM评估问答或临床推理[21 (https://arxiv.org/html/2607.18696#bib.bib21),22 (https://arxiv.org/html/2607.18696#bib.bib22),23 (https://arxiv.org/html/2607.18696#bib.bib23)]。生物制药资产决策则不同:结果历时多年,一个后来看似错误的决策在历史截点时可能完全是合理的。因此我们采用时间截点、允许资源列表、隐藏结果、可接受决策集、自动评分和盲测成对评判。

#### AI智能体的组织设计。

许多智能体系统通过为智能体分配角色如科学家、工程师、经理、审稿人或规划者,隐含地复制了人类组织。在生物制药领域,这种映射尤其诱人,因为人类公司已经拥有定义明确的职能。然而,人类组织是围绕人类协调成本设计的。如果智能体可以共享状态并动态加载技能,那么更好的组织原语可能是一个对象、工作流程或目标函数,而非部门。

## 3 基准设计

### 3.1 任务定义

每个基准案例呈现一个基于历史事实的生物制药决策。智能体组织收到案例标题和提示、一个截止日期、一个允许的公共资源列表(这些资源在截点或之前发布)、允许的决策(执行、终止、观望或合作)、以及一个通用的JSON输出模式。模型不会收到基准类别、隐藏结果、黄金决策、可接受决策集或评分注释。它必须返回一个结构化的决策,包含置信度、主张、证据、反证、不确定性、警示信号、下一步行动以及审计轨迹。

### 3.2 数据集

当前基准包含45个回顾性案例:13个BD/竞争案例、10个失败案例、12个混合监管或证据案例,以及10个成功案例。示例包括司美格鲁肽在肥胖症、索塔西普在肺动脉高压、exa-cel在镰状细胞病、KarXT在精神分裂症、selonsertib和奥贝胆酸在NASH、bempegaldesleukin在黑色素瘤、aducanumab在阿尔茨海默病、Elevidys在杜氏肌营养不良、roxadustat在慢性肾病贫血、默克-Acceleron、辉瑞-Seagen、吉利德-Forty Seven、艾伯维-ImmunoGen以及BMS-Karuna。所有案例均基于公共资源构建,并根据案例截点进行了日期核查。本次提交附带公开的辅助文件,该文件移除了

相似文章

大多数公司的人工智能问题不在于模型

Reddit r/artificial

一项分析指出,公司在人工智能方面失败的原因在于它们专注于模型,而非基础层——流程设计、治理、知识架构、人工判断和反馈循环——而这些才是真正的价值来源。文章引用了纳德拉的“令牌资本”概念、苹果可切换模型的Siri,以及显示战略与执行之间存在巨大差距的调查数据。

AI代理是否会让公司变得更同质化?

Reddit r/ArtificialInteligence

反思AI代理是否可能因依赖默认模型推理而非编码的业务特定逻辑而导致公司同质化,质疑编码运营逻辑未来的护城河作用。