Claude Fable 5 在生物医学挑战问题上的能力
摘要
本文评估了 Claude Fable 5 在八个生物医学基准上的表现,发现尽管拒绝率很高(8-99.4%),但模型在回答时达到了卓越的准确率,突显了参与意愿是主要限制因素。
arXiv:2607.10849v1 公告类型:新
摘要:前沿语言模型在生物医学基准上的评估日益增多,但两个问题削弱了大多数已发表评估的有效性:旧有基准已接近饱和,且开放式回答由其他语言模型评分。我们评估了 Anthropic 最强大的公开模型 Claude Fable 5 在八个生物医学基准上的表现,包括四个文本基准和四个多模态基准,全程采用确定性评分与固定答案键。我们纳入了两个 Claude 前代模型和 GPT-5 作为基线。在每个结果表格中,拒绝被记录为一个独立结果。这一决策导致了本文的核心发现:Fable 5 的拒绝率因基准而异,介于 8.0% 到 99.4% 之间,这种模式在前代模型和 GPT-5 中均不存在。一旦将拒绝项从分母中排除,Fable 5 在本研究的所有基准上的准确率均超过或等于其他所有模型。我们识别出两种可区分的拒绝模式:一种集中在 MedQA 和 MedXpertQA MM 中的基础科学和机制内容上,通过两个基准各自分类标签独立确认;另一种是 RareBench 上的疾病领域模式,其中先天性代谢疾病表现几乎被普遍拒绝,而成人起病的自身免疫表现则不然。Fable 5 在生物医学领域实用性的主要限制是参与意愿,而非其实际能力。
查看缓存全文
缓存时间: 2026/07/14 04:23
# Claude Fable 5 在生物医学挑战问题上的能力表现
来源:https://arxiv.org/html/2607.10849
Dominic Okonkwo1\*, Magnus Hodgson1, Temitope I. David2, Susan Adanna Ihejirika3
1 佐治亚大学计算学院
2 伊利诺伊大学化学系
3 佐治亚大学生物信息学研究所
## 摘要
前沿语言模型在生物医学基准上的评估日益增多,但两个问题削弱了大多数已发表评估的有效性:传统基准已接近饱和,开放式回答由其他语言模型评分。我们评估了 Anthropic 最强大的公开可用模型 Claude Fable 5,涵盖八个生物医学基准(四个文本、四个多模态),全程使用确定性评分,依据固定答案键。我们纳入两位 Claude 前代模型和 GPT-5 作为基线。拒绝回答在每个结果表中被记录为单独的结果。这一决策产生了本文的核心发现。Fable 5 根据基准不同,拒绝回答率在 8.0% 至 99.4% 之间,这种模式在其前代模型及 GPT-5 上均未出现。一旦从分母中排除拒绝项,Fable 5 在本研究的所有基准上的准确率均达到或超过其他所有模型。我们识别出两种可区分的拒绝模式:一种集中在 MedQA 和 MedXpertQA MM 的基础科学和机制内容上,通过两个基准各自的类别标签得到独立确认;另一种是 RareBench 上的疾病领域模式,其中先天性代谢疾病表现被几乎普遍拒绝,而成人发病的自身免疫表现则未被拒绝。Fable 5 生物医学可用性的主要限制是参与意愿,而非其回答能力。
![[无标题图片]](https://arxiv.org/html/2607.10849v1/x1.png)
本研究所评估的八个生物医学基准概览。八个生物医学基准上的原始准确率;拒绝率以红色标注(≥5% 时)。
## 1. 引言
语言模型的生物医学评估未能跟上模型本身的发展。每个新的前沿模型都声称更强的科学推理能力,每份新的模型报告都以一堵基准分数墙开场。但两种具体做法悄悄削弱了这些分数的含义。首先,模型已变得足够强大,许多既定考试不再能区分不同系统,前沿模型在 USMLE 类考试上常规性超过 90% 准确率[undef (https://arxiv.org/html/2607.10849#bib.bibx1)]——一旦所有模型得分相同,基准便不再告诉你哪个实际上更好。其次,评分越来越多地外包给其他语言模型,这意味着评估的可靠性取决于判官模型的好坏[undefa (https://arxiv.org/html/2607.10849#bib.bibx2)]。这两个问题都不意味着现有基准没有价值;它意味着要善用它们,需要谨慎选择哪些基准仍有区分模型的余地,并以不引入第二个不负责任的模型进入判断的方式评分。这在医学和生物学领域尤其如此,因为“听起来正确”与“实际正确”之间的差距比几乎任何其他领域都更重要。琐事基准上的错误答案只是好奇心的问题。关于罕见病、药物相互作用或实验室图像的错误答案则不然。在该领域评估模型必须做的不仅仅是确认它能通过五年前还很难的考试。它必须测试至今仍困难的推理能力,拒绝让另一个语言模型悄悄决定什么算正确,并认真对待真实的生物医学问题越来越常附带图像——扫描、切片、图表,而不仅仅是文本[undefb (https://arxiv.org/html/2607.10849#bib.bibx3)]。
Claude Fable 5 是本文的研究对象。它是 Anthropic 最强大的公开可用模型,通过大规模强化学习训练,定位于科学和医学推理的进步。于 2026 年 6 月 9 日发布,2026 年 7 月 1 日恢复公共 API 访问,其生物医学能力尚未在已发表的文献中得到独立评估。本文提供这一评估,遵循为前沿模型在医学基准上建立的零样本、直接回答评估模板[undefc (https://arxiv.org/html/2607.10849#bib.bibx4)],并增加了大多数评估跳过的两个约束:每个基准都根据固定答案键评分,绝不通过另一个模型的判断;拒绝回答被记录并报告为独立结果,不悄悄归入错误。我们的主要证据基准是特意选择的,因为当前前沿模型尚未让它们达到上限;另外两个基准尽管接近天花板仍被纳入,正是因为它们的饱和让我们能衡量自首次使用以来该领域已走了多远。
大多数评估将拒绝回答等同于错误答案。本文不这样做。
大型语言模型中的拒绝行为——模型拒绝回应而非产生答案——日益被理解为一种独立的模型输出类别,由训练后对齐塑造,而非仅由能力决定[undefd (https://arxiv.org/html/2607.10849#bib.bibx5)]。拒绝回答的模型与自信且错误回答的模型不是同一种失败,抹杀这一区别恰恰丢弃了在决定是否在真实临床或研究环境中部署模型时最重要的信息。这一决策结果产生了本文的核心发现,这一发现不仅出现在最可能触发拒绝的基准上,而且几乎出现在本研究的所有数据集中,包括我们仅因历史可比性而纳入并预期无显著发现的基准。
本文做出四项贡献。第一,涵盖 MedQA[undefe (https://arxiv.org/html/2607.10849#bib.bibx6)]、PubMedQA[undeff (https://arxiv.org/html/2607.10849#bib.bibx7)]、MedXpertQA[undefb (https://arxiv.org/html/2607.10849#bib.bibx3)] 和 RareBench[undefg (https://arxiv.org/html/2607.10849#bib.bibx8)] 的文本评估,前两个因与先前工作的可比性而保留(尽管已接近饱和),后两个则因当前模型仍明显表现困难而选择。第二,使用 VQA-RAD[undefh (https://arxiv.org/html/2607.10849#bib.bibx9)]、SLAKE[undefi (https://arxiv.org/html/2607.10849#bib.bibx10)]、PathVQA[undefj (https://arxiv.org/html/2607.10849#bib.bibx11)] 和 MedXpertQA 多模态子集[undefb (https://arxiv.org/html/2607.10849#bib.bibx3)]中更难的开放回答部分进行多模态评估,跳过已无法区分前沿系统的封闭回答子集。第三,在匹配的提示和评分条件下与 GPT-5[undefk (https://arxiv.org/html/2607.10849#bib.bibx12)] 进行比较。第四,在单一模型家族内进行代际追踪——Claude Opus 4.6、Opus 4.8 和 Fable 5——在相同协议下评估,记录生物医学能力是否真的在发布间提升,或只是看起来提升。
拒绝回答在本文的每个结果中作为独立结果报告,不悄悄融入准确率分数。这些拒绝意味着什么,为何发生,以及它们揭示了 Fable 5 在压力下何地坚持、何地放弃——这就是本文的目的。任何决定是否信任它处理真实生物医学问题的人都应得到这个答案,而不是埋藏在排行榜数字中。
## 2. 方法论
### 2.1. 模型
我们评估四个模型:Claude Fable 5(主要研究对象)、Claude Opus 4.6 和 Opus 4.8(同家族前代)、以及 OpenAI 的 GPT-5(外部基线)。我们通过 Anthropic Messages API 访问所有 Claude 模型,通过 OpenAI Chat Completions API 访问 GPT-5。所有四个模型均具备视觉能力,这是多模态阶段所必需的。
| 基准 | n | 任务/领域 |
|------|---|-----------|
| **文本基准** | | |
| MedQA | 1,273 | USMLE 式临床 MCQ |
| PubMedQA | 1,000 | 生物医学文献 QA |
| MedXpertQA | 2,450 | 专科委员会考试 QA |
| RareBench | 1,122 | 罕见病诊断 |
| **多模态基准** | | |
| MedXpertQA MM | 400 | 专科临床图像 |
| VQA-RAD | 179 | 放射学 VQA |
| SLAKE | 250 | 放射学 VQA |
| PathVQA | 171 | 组织病理学 VQA |
表 1:本研究使用的生物医学基准。
### 2.2. 数据集
我们评估分两个阶段进行:纯文本和多模态,共涵盖八个基准。表 1 (https://arxiv.org/html/2607.10849#S2.T1) 总结了每个基准的大小、领域及在本研究中的作用。在文本阶段,MedQA 和 PubMedQA 作为传统锚点;MedXpertQA 文本和 RareBench 作为主要证据基准。在多模态阶段,我们从四个基于图像的基准中采样 1,000 个项目,这些基准涵盖放射学、多模态成像和组织病理学,使用固定随机种子,仅从开放回答子集中抽取(这些子集保留更大空间)。MedXpertQA MM 采用专科水平、五到十个选项的格式,涵盖 17 个专科,设计上与较短回答的 VQA-RAD、SLAKE 和 PathVQA 任务不同。我们使用 VQA-RAD 完整可用的开放回答测试集,将 SLAKE 过滤为英文开放回答问题,并从更大的组织病理学池中对 PathVQA 进行子采样以控制成本。
### 2.3. 提示词
所有评估均在零样本、直接回答提示条件下进行。我们不使用少样本示例、思维链指令、检索增强或扩展思考。每个模型接收单轮用户消息,无系统提示。对于 MCQ 基准,我们指示模型将最终答案放在最后一行,格式为 "ANSWER: "。对于开放回答的 VQA 基准,我们指示模型简短回答(一个词或短语),格式为 "ANSWER: "。对于 PubMedQA,我们预置摘要上下文并指示模型仅基于该上下文回答 "yes, no, or maybe"。对于 RareBench,我们将人类表型本体 (HPO) 代码[undefl (https://arxiv.org/html/2607.10849#bib.bibx13)] 转换为人类可读的症状名称,并请求十个排名候选诊断,使用如下所示提示。在发现该提示下近乎完全拒绝(第 3.2 节 (https://arxiv.org/html/2607.10849#S3.SS2))后,我们对所有原始拒绝项运行了二次中性框架条件,以测试临床角色框架是否为促成因素。
**RareBench - 主要提示**
你是一个临床决策支持系统,协助专科医生。以下表型特征已记录在一个罕见病诊断评估病例中:
{symptom\_str}
基于此表型概况,提供最符合这些特征的前 10 个罕见病诊断,按可能性从高到低排序。以编号列表结束你的回答,格式如下:
TOP10: 1. 2. 3. ...
**RareBench - 中性提示**
一位患者具有以下临床特征:
{symptom\_str}
列出最可能的十个诊断,按可能性从高到低排序。以如下格式回答:
TOP10: 1. 2. 3. ...
后一种条件仅作为拒绝发现上的稳健性检查,不取代本文在 RareBench 上报告的主要提示结果。
### 2.4. 图像处理
对于多模态阶段,我们将每张图像从磁盘加载,如果任一维度超过 1,568 像素则调整大小,并编码为 base64 JPEG。我们将图像以 base64 内容块形式传递给 Claude 模型,位于文本提示之前;对于 GPT-5,以内联 base64 数据 URI 形式传递。对于 MedXpertQA MM 中多图像病例,我们将该病例的所有图像一起提交到单个 API 调用中,按数据集元数据给定的顺序。
| 模型 | MedQA | PubMedQA | MedXpertQA Text |
|------|-------|----------|-----------------|
| | 原始 | 评分后 | 原始 | 评分后 | 原始 | 评分后 |
| Fable 5 | 79.7% | 96.6% [95.3, 97.5] | 65.0% | 81.3% [78.4, 83.8] | 57.7% | 66.1% [64.0, 68.0] |
| Opus 4.8 | 95.0% [93.6, 96.0] – (0.4% ref.) | - | 75.2% [72.4, 77.8] – (0.0% ref.) | - | 52.7% [50.8, 54.7] – (0.3% ref.) | - |
| Opus 4.6 | 94.3% [92.9, 95.5] – (0.2% ref.) | - | 76.6% [73.9, 79.1] – (0.0% ref.) | - | 50.5% [48.6, 52.5] – (0.1% ref.) | - |
| GPT-5 | 96.0% [94.8, 96.9] – (0.0% ref.) | - | 71.7% [68.8, 74.4] – (0.0% ref.) | - | 54.6% [52.7, 56.6] – (0.0% ref.) | - |
表 2:文本基准性能。评分后准确率排除拒绝项的分母。95% Wilson 置信区间在括号中。
| 模型 | n | 拒绝数 (n, %) | 评分后 n | R@1 | R@5 | R@10 |
|------|---|---------------|----------|-----|-----|------|
| Fable 5 | 1,122 | 1,115 (99.4%) | 6 | 0.36% [0.1, 0.9] | 0.45% [0.2, 1.0] | 0.45% [0.2, 1.0] |
| Opus 4.8 | 1,122 | 0 (0.0%) | 1,122 | 27.4% [24.8, 30.0] | 40.5% [37.6, 43.4] | 56.8% [53.9, 59.6] |
| Opus 4.6 | 1,122 | 0 (0.0%) | 1,122 | 20.9% [18.6, 23.3] | 34.1% [31.3, 36.9] | 47.5% [44.6, 50.4] |
| GPT-5 | 1,122 | 0 (0.0%) | 1,079 | 27.7% [25.2, 30.4] | 41.0% [38.2, 43.9] | 49.4% [46.5, 52.3] |
表 3:主要提示下 RareBench 的表现。Fable 5 拒绝了 99.4% 的项目;准确率数字仅反映 6 个评分后的回答。
### 2.5. 评分与拒绝处理
所有基准均通过固定答案键进行确定性评分;本研究中没有基准使用基于 LLM 的判断。我们在每个百分比上报告 95% Wilson 置信区间。每个 API 调用在评分前记录原始响应文本、API 报告模型标识符、停止原因、令牌计数及任何错误字符串;我们将 API 报告模型标识符视为最佳努力信号,而非内部路由的确认记录。对于 RareBench,我们通过精确匹配、子串包含、然后模糊匹配(截止值 0.6)将预测诊断名称与规范名称字典进行匹配,并报告 Recall@1、Recall@5 和 Recall@10。对于开放回答的 VQA 基准,我们通过对地面真实简短答案进行精确匹配或子串包含来评分标准化预测的正确性。如果 API 停止原因指示拒绝或响应文本匹配固定的拒绝关键词模式集(在所有模型和所有八个基准上相同应用),我们将响应标记为拒绝。我们将拒绝记录为独立结果,并在每个结果表中从正确性分母中排除。只要模型的拒绝率不可忽略,我们就报告原始准确率(拒绝算作对模型不利)和评分子集准确率(排除拒绝的分母)。
## 3. 结果
### 3.1. 拒绝抑制了 Fable 5 的原始分数
在所有八个基准上,Fable 5 的原始准确率低于其实际能力。其他三个模型——Opus 4.6、Opus 4.8 和 GPT-5——在文本基准上拒绝 0.0% 至 0.4% 的问题,在大多数多模态基准上比率相当。Fable 5 不遵循这一模式。它在 MedQA 上拒绝 17.4%(222/1,273),PubMedQA 上 20.0%(200/1,000),MedXpertQA 文本上 12.4%(305/2,450),PathVQA 上 41.5%(71/171),MedXpertQA MM 上 8.0%(32/400)。图 1 (https://arxiv.org/html/2607.10849#S3.F1) 显示了所有八个基准的拒绝率。在 RareBench 上,拒绝是主要结果;我们在第 3.2 节 (https://arxiv.org/html/2607.10849#S3.SS2) 中单独详述。
引用图注
图 1:所有被评估生物医学基准上的拒绝率。
一旦将拒绝与正确性分离,Fable 5 在其拒绝率不可忽略的每个基准上的排名从四个模型的最后一名跃升至领先。表 2 (https://arxiv.org/html/2607.10849#S2.T2) 报告了文本基准的原始准确率和评分子集准确率(仅基于每个模型实际回答的项目计算)。在 MedQA 上,Fable 5 的评分子集准确率(96.6% [95.3, 97.5])达到或超过其他所有模型的原始准确率(94.3–96.0%)。在 PubMedQA 上,其评分子集准确率(81.3% [78.4, 83.8])超过相似文章
Claude Fable 5:编码任务的中等表现
Anthropic的Claude Fable 5模型在真实的漏洞修复任务中表现中等,出现大量超时和高作弊量,但也解决了四个先前模型未破解的实例。
Claude Fable 5 基准测试
Anthropic 发布了 Claude Fable 5(一款新的人工智能模型)的基准测试,显示出显著的性能提升。
Claude Fable 无法回答基础生物学问题
Anthropic 新发布的 Claude Fable 5 模型因过于保守的安全过滤器拒绝回答基础生物学问题,这些过滤器旨在防止生物武器滥用,凸显了能力与安全性之间的权衡。
Claude Fable 5 在 Artificial Analysis 上获得 65 分
Claude Fable 5 在 Artificial Analysis 智能指数上取得了 65 分。
Claude Fable 具有不懈的主动性
文章描述了 Claude Fable 5(一款AI模型)如何通过自主使用浏览器自动化、Shell命令和自定义脚本调试UI问题,展现出不懈的主动性,展示了先进的工具使用能力。