@james_y_zou: 我们将超过22万份FDA监管文件和超过100万份临床试验文档添加到了#paperclip。所有这些都原生编入索引,供智能体使用,而且免费。现在……
摘要
Paperclip新增了超过22万份FDA监管文件和来自多个登记处的100多万份临床试验,使AI智能体无需网络搜索即可搜索和推理临床与监管数据。此次更新允许用户通过统一的文件系统界面查询FDA文档、ClinicalTrials.gov以及国际登记处的信息。
查看缓存全文
缓存时间: 2026/05/22 17:57
我们已将超过22万份FDA监管文件和超过100万份临床试验文档加入#paperclip。所有内容均原生构建索引,供智能体使用,且完全免费。现在,智能体无需网络搜索即可轻松推理临床研究!例如:找出所有虽未达到终点但仍获批的试验。https://t.co/30GGqfCQmO https://t.co/LlU84ClJC0
将监管与临床领域引入 Paperclip — GXL 博客
来源:https://gxl.ai/blog/adding-regulatory-clinical
今天,我们向 Paperclip 新增了 22.5 万份 FDA 监管文档、来自 19 个注册库(ClinicalTrials.gov、EudraCT、CTIS、ISRCTN、UMIN、JRCT、ChiCTR,以及涵盖印度、伊朗、澳大利亚/新西兰、德国、荷兰、韩国、泰国、巴西和非洲的 13 个 WHO ICTRP 注册库)的 100 万项临床试验,以及来自 EMA 和日本 PMDA 的国际监管申报资料。
对于现有 Paperclip 用户:运行 paperclip update,即可立即搜索 FDA 文档和临床试验。提示您的智能体搜索 FDA 文档、ClinicalTrials.gov 注册信息或国际监管申报资料。
| 数据源 | 数量 | 说明 |
|---|---|---|
| 美国 FDA | 22.5 万份 | 美国 FDA 文档:NDA/BDA 审评包、临床与药理学审评、批件、说明书、顾问委员会转录、橙皮书、药品短缺信息、NDC 目录 |
| ClinicalTrials.gov | 58 万项 | ClinicalTrials.gov 完整试验注册信息,包括研究设计、分组、入排标准、终点、结果、不良事件、申办方与研究者详情,以及每项试验相关文档的全文 |
| 国际注册库 | 🇪🇺 8K 份 EMA 评估报告、🇯🇵 22K 份日本 PMDA 审评、🇨🇳 116K 项中国临床试验、🇨🇳 14K 份中国药品报销信息、🌐 133K 项 WHO ICTRP 注册信息 |
为何重要
学术论文是研究人员知识库的核心部分,但远非全部。在实践中,生物技术研究需要汇集来自各种来源的数据,才能拼凑出完整的图景。药物开发流程依赖于分布在互不兼容的数据源中的监管与临床证据。每个数据库都有自己的搜索界面、元数据模式和更新节奏。国际注册库还引入了语言、司法管辖区和标识符惯例的额外限制,使得跨源综合难以自动化。
Paperclip 将美国 FDA 文档、ClinicalTrials.gov 注册信息以及国际监管和试验语料库索引到一个虚拟文件系统中,可通过 search、grep、SQL 和标准 Unix 风格管道访问。
$ ls /fda/
drugs@fda/ 225,411 份文档
NDA 和 BLA 审评包、临床与药理学审评、批件、说明书、顾问委员会转录、橙皮书、药品短缺信息、NDC 目录
$ ls /trials/
clinicaltrials.gov/ 580,000 项试验
研究设计、分组、入排标准、终点、结果、不良事件、申办方与研究者详情
eu/ 85,000 项试验 (EudraCT + CTIS)
japan/ 66,000 项试验 (UMIN + JRCT + JapicCTI)
china/ 116,000 项试验 (ChiCTR)
who_ictrp/ 133,000 项试验 (13 个注册库)
下面,我们通过三个案例研究展示该语料库所能实现的功能:
复现已发表分析
作者:Jake Silberg (https://jsilbergds.github.io/),斯坦福大学生物医学数据科学博士
TL;DR
我们请斯坦福大学研究员兼博士生 Jake Silberg 使用 Paperclip 复现一篇分析 FDA 批准但未达到主要终点的药物的论文。使用 Claude Code 和 Paperclip 的智能体标记了原始论文中的 18/21 种药物(召回率 86%),而仅依赖网络搜索的智能体标记了 15/21 种。Paperclip 智能体在复现分析时的速度是前者的 2.1 倍,成本低 47%。
在 2018 年至 2021 年间,约 10% 的 FDA 批准药物在其关键试验中至少有一个主要终点未达到。识别这些案例对于理解该机构如何在统计严谨性与未满足医疗需求之间取得平衡至关重要。我们测试了智能体能否从源文档中复现这一分析。
结果
从原始论文中标记出的药物
(此处应有表格或图表,但原文中仅有文字描述)
Paperclip 智能体标记了原始论文中 21 种未达到终点的药物中的 18 种(召回率 86%),而未使用 Paperclip 的智能体仅标记了 15 种。前者共标记了 27 种药物,因此有 9 种不在原始论文中;后者标记了 11 种不在原始论文中的药物。
每种药物的中位成本
Paperclip 智能体每种药物仅花费 0.45 美元(Claude 点数),而未使用 Paperclip 的智能体花费 0.85 美元。
每种药物的中位用时
使用 Paperclip 时,每种药物的分析仅需 65 秒,而未使用时需要 136 秒。所有数字均为中位数。
关键结论: Paperclip 让智能体得到答案的速度是 2.1 倍,成本降低 47%。两个智能体在复现关键分析方面都表现出色,但 Paperclip 显然有所帮助。
示例
我们可以看看使用 Paperclip 的智能体的一些具体成功案例。它能够直接引用其访问的 Drugs@FDA 文档中的原文。例如,对于 Aduhelm,它引用了统计审评员的说法:“我们有第二个大型、充分且良好对照的研究……其显著性水平远未达到”,并提供了行号以验证引用与 FDA 文档完全一致。这些逐字细节有助于用户理解复杂的终点系列,例如对于 Tavneos,预先指定的标准涉及评估非劣效性,然后评估优效性。该智能体再次提供了关键点的行号:“在第 26 周,非劣效性比较具有统计学显著性……但未证明优效性”,并注明“终点未满足所有预先指定的标准”。
在智能体遗漏原始论文中标记的药物时,通常是由于判断差异,而这些差异在其推理过程中有文档记录。例如,两个智能体都遗漏了 Danyelza 的一个终点,FDA 将该终点的置信区间下限重新评估为 20%,而预先指定的标准是“高于 20%”。虽然 Paperclip 智能体没有正确将其计为失败,但它注意到该区间“四舍五入正好是 20%,造成了模糊性”。另一个例子是,当 Paperclip 智能体评估 Nourianz 时,它注意到不同文档列出了不同的关键试验。因此,虽然它发现了失败的终点,但并未将该试验视为正式的关键试验。因此,尽管我们关注智能体的最终二元判断,但基于 Paperclip 文档的详细推理往往确实发现了细微差别。
最后,我们可以分析使用 Paperclip 的智能体标记的额外药物。对于某些药物,智能体只是过度包容,例如将 Tauvid 的一个非获批适应症试验误认为关键试验。但对于其他药物,智能体可能是有道理的。例如,Barhemsys 在其 DP10018 试验中有一个失败的终点,FDA 指出:“基于预先指定的 Bonferroni 程序,两个 p 值在单侧 0.0125 水平上均无统计学显著性”。后来在另一种事后程序下,这一结果被修正为具有显著性。但完全有理由认为 Barhemsys 也应当被纳入原始论文中。这展示了强大智能体访问正确文档、发掘额外细微差别供人工审阅的价-值。
方法
当 FDA 在主要终点未达到的情况下仍批准一种药物时,这表明总证据(包括次要终点、亚组分析和未满足医疗需求)压倒了对预先指定统计计划的严格解读。这些案例对于设计自己的关键试验的申办方来说至关重要:它们揭示了机构在何种条件下行使灵活性,以及哪些证据阈值指导了这些决策。系统性地识别此类案例需要阅读数百份密集的审评文档,并将统计分析计划与报告的结果进行交叉引用。
由于 Drugs@FDA 数据库包含大量关于审批过程的信息,因此它是生物医学研究人员丰富的数据源。近期论文分析了从 FDA 如何从临床试验外推以确定获批人群(链接:https://jamanetwork.com/journals/jamanetworkopen/fullarticle/2791292)到肿瘤药审批过程中未在最终药品说明书中报告的不确定性(链接:https://www.healthaffairs.org/doi/10.1377/hlthaff.2024.01134?url_ver=Z39.88-2003&rfr_id=ori%3Arid%3Acrossref.org&rfr_dat=cr_pub++0pubmed)等多方面内容。特别详细的一篇论文是对 2018–2021 年药物的分析(链接:https://jamanetwork.com/journals/jamainternalmedicine/fullarticle/2801023),发现大约 10%(21 种药物)的关键试验中有一个主要终点未达到,但仍获得了 FDA 批准。
我们想测试智能体在无法访问原始论文结果的情况下,能否复现这一分析。为此,我们设置了两个实验:第一,使用 Claude Code SDK 智能体(Opus 4.7,具备 WebFetch 和网络搜索能力,可从 FDA 网站抓取 PDF);第二,另一个智能体除了这些工具外,还可使用 Paperclip 直接读取关键审评文档。除了访问审评文档的方式不同外,提示词完全相同,均包含论文中使用的方法描述(但不包含论文的具体结果)。两个智能体都收到了研究时间段内的 NDA 和 BLA 列表。一个运行脚本启动了并行 Claude Code SDK 会话,每个会话都收到包含论文方法的相同指令。提示词包括:
1. 确定审批包中的所有关键试验。
2. 对于每个关键试验,确定相关的有效性主要终点。
3. 对于每个主要终点,确定其是否满足预先指定的标准。
并指定了结构化回复格式。Paperclip 智能体收到一个脚本,用于拉取该申请的文档;另一个智能体则被告知:
您有网络访问权限(WebFetch、带有 curl/wget 的 Bash)。
FDA 资源:
- Drugs@FDA: https://www.accessdata.fda.gov/scripts/cder/daf/
- openFDA API: https://api.fda.gov/drug/drugsfda.json
- ApplicationDocs: PDF 位于 /drugsatfda_docs/ 的相应路径下。
阅读 FDA 综合审评文档。文件名通常包含 MedR、SumR、IntegratedR、MultidisciplineR。分析细节可能需要 StatR。
其他工具被阻止以防篡改。
在写出关于每个关键试验和任何失败终点的推理后,智能体必须以 YES、NO 或 UNCLEAR 给出最终答案。然后,我们将 UNCLEAR 的药物交给第二个解析智能体,该智能体仅阅读叙述(而非原始文档)并做出最终选择。该解析器的提示词在两个设置中完全相同。解析器的成本和时间微乎其微,因为它只阅读简短的叙述并给出两句话的答案。
关键收获: 直接访问 FDA 审评文档使智能体能够阅读实际的统计审评员语言,引用行号,并推理模糊的终点。结果是更高的召回率(86% vs. 71%),2.1 倍更快的执行速度,以及每种药物分析成本降低 47%。
规划一项 I 期研究
该问题由一位生物技术初创公司创始人兼前 FDA 员工提供。早期药物开发需要综合来自分散在试验注册库、FDA 监管申报文件和科学文献中的数百个先前项目的先例。这是一个案例研究,展示了 Paperclip 能检索到什么,而仅凭网络搜索无法做到什么。
TL;DR
针对一个关于 BTK 降解剂的三个部分组成的临床开发问题,Paperclip 找出了 18 个先前化合物(映射到不同地域)、9 个先例试验设计(包含日本队列细节)和 7 个经过验证的检测平台。仅使用网络搜索的基线只能从 CRO 自己的营销页面上识别出澳大利亚的 CRO 站点,但无法回答关于地域、试验设计或生物标志物的问题,因为这些信息需要访问 FDA 监管申报文件和临床试验方案,而搜索引擎未对这些内容建立索引。
背景
BTK(布鲁顿酪氨酸激酶)是一种参与某些血癌和自身免疫病生长的蛋白质。阻断 BTK 的药物,如伊布替尼(Imbruvica),在过去十年中已成为血癌治疗最重要的进展之一。新一代药物称为 BTK 降解剂 更进一步:它们不是简单阻断 BTK,而是将其标记为被细胞自身的回收机制破坏,从而完全消除该蛋白质。这种方法可以克服对标准 BTK 抑制剂的耐药性。
在一种新药能在癌症患者中进行测试之前,它必须首先在精心控制的 首次人体(FIH)研究 中证明其安全性,通常是在健康志愿者中进行。该场景中的公司计划在澳大利亚进行这项首次研究,这是 FIH 试验的热门选择,因为其监管宽松、启动时间快,并计划增加一个日本志愿者队列,以支持在日本获得监管批准。规划这项研究需要三种高度专业化的知识,这些知识通过网络搜索不易找到:
- 先例地域: 类似药物在哪里首次在人体中进行测试?这对我们设计项目有何启示?
- 试验设计先例: 将日本种族桥接队列与标准 FIH 设计结合的研究在实际中是什么样的?哪些澳大利亚临床站点以前做过类似研究?
- 药效学生物标志物: 一旦药物进入人体,我们如何测量它是否真的降解了其靶蛋白?答案取决于药物是阻断、可逆抑制还是完全破坏靶点。选择错误的检测方法会浪费时间,并掩盖药物是否有效。
查询:
我们正计划在澳大利亚为一种 BTK 降解剂进行 SAD/MAD 首次人体研究,并附加一个日本 MAD 队列用于种族桥接。请回答以下问题:
- BTK 抑制剂和降解剂的健康志愿者 FIH 研究历史上有哪些地区进行过?涵盖所有地域。
- 之前在澳大利亚进行过的类似临床试验设计(SAD/MAD 附加日本队列)有哪些示例?涉及哪些临床站点和 CRO?
- BTK 靶点占有率检测是如何开发和验证的?请给出技术细节。涵盖可接受的样本基质、作用机制适用性(共价、非共价、降解剂)以及优缺点。
问题1:类似药物首次在人体中测试的地点
了解先前 BTK 项目在何处进行首次人体研究以及为何选择这些地点,对于为新降解剂项目选择合适的地点和人群至关重要。这需要了解 BTK 化合物开发的完整格局,而不仅仅是少数获批药物。
Opus 4.6 + Paperclip
根据作用机制类别,列出了 18 种化合物及其特定 NCT 编号、申办方和地域:
- 12 种共价抑制剂(伊布替尼、阿可替尼、泽布替尼、替拉替尼、奥拉替尼、埃沃布替尼、托莱布替尼、雷米布替尼、布兰布替尼、利扎布替尼、厄素布替尼)
- 3 种可逆抑制剂(匹妥布替尼、菲内布替尼、尼马布替尼)
- 3 种降解剂/PROTAC(NX-2127、NX-5948、HSK29116)
识别出在 6 个地域 进行的 FIH:美国(主导)、澳大利亚(泽布替尼 CTN 方案)、中国(奥拉替尼、HSK29116)、英国(替拉替尼)、欧洲(埃沃布替尼、雷米布替尼),并指出日本从未是主要的 FIH 地点。关键模式:肿瘤 BTK 项目在患者中进行 FIH;自身免疫项目使用健康志愿者。
相似文章
@martinfowler: 新文章 我们与拜耳合作使用AI,帮助药物研究人员查询埋藏在PDF报告中数十年积累的信息…
Martin Fowler 和拜耳分享了构建 PRINCE 的历程,这是一个使用RAG的自主AI系统,帮助研究人员查询数十年来的PDF报告,从而变革了临床前数据检索方式。
@tom_doerr: AIPOCH 整理了一个包含超过550个医学研究智能体技能的库,支持证据洞察、方案设计等工作流程…
AIPOCH 发布了包含超过550个医学研究智能体技能的精选库,用于支持证据洞察、方案设计、数据分析和学术写作,并且兼容 Claude Code 和 Codex 等多个 AI 智能体平台。
如何用 Paperclip AI 打造零员工企业
Paperclip 是一款开源的多智能体编排系统,可在 VPS 上 7×24 小时运行 AI 驱动公司,通过类 GitHub Issue 工作流,让不同角色的智能体完成研究、写作、编辑等任务。
用了一段时间Paperclip,不习惯工单系统,现在换了个工具试试
一位内容营销人员分享了从Paperclip工单系统转向Alook的经历。Alook是一种AI代理工具,代理之间通过邮件处理交接并共享记忆,减少了人工监督。
@iluciddreaming: GitHub 上有个 repo,138 个科学研究工具的 Agent Skill,24.7k stars。 覆盖生物信息、药物发现、临床数据库——Scanpy、RDKit、DeepChem、UniProt、AlphaFold 全在里面。 …
GitHub 上一个名为 scientific-agent-skills 的仓库收录了138个科学研究工具的Agent Skill,覆盖生物信息、药物发现、临床数据库等领域,支持一行命令集成到AI代理中,提供精准的API调用方式。