超越一致性:为策展人筛选评分面板浮现的生物医学实体候选

arXiv cs.CL 论文

摘要

本文介绍了BioConCal,一种监督评分器,它利用推理时的面板和候选特征对LLM面板浮现的生物医学实体候选进行排序,在策展人筛选方面显著优于原始一致性。

arXiv:2605.30826v1 公告类型:新 摘要:生物医学命名实体识别(NER)对现代LLM来说看似简单:合理的生物医学提及很容易浮现,但语料库惯例的正确性取决于注释惯例、跨度边界、实体粒度和类型模式。多LLM一致性是一个显著性信号,而非语料库惯例的正确性。我们引入了一个候选级面板输出基准,用于面板浮现的候选验证,其中单位是由明确定义的多模型面板浮现的对齐候选,而非独立提取器输出。该基准将八个LLM在五个公开生物医学NER数据集上的预测对齐到一个候选主表中。BioConCal是一个域内监督评分器,通过推理时的无金标准一致性、提及、表面可用性和文档特征实例化这一层,针对固定的候选流。在域内,BioConCal将AUROC从原始一致性的0.753提升到0.910。在验证选择的0.95精确率目标下,它选择了1,340个候选,经验测试精确率为0.939,而原始一致性仅选择293个。这对应于候选级召回率0.592和语料库级召回率0.523,而面板内行标签上限为0.883。主要好处并非恢复被所有面板成员遗漏的实体,而是将嘈杂的面板流重塑为更高产出的审查队列。在实体类型偏移下,阈值需要目标域验证,精确字符定位仍是一个单独的确定性后处理步骤。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:29

# 超越共识:为策展人分诊对面板浮现的生物医学实体候选进行评分

**来源:** https://arxiv.org/html/2605.30826

舒恒曹1,∗,陈瑞琪2,∗,曹仁杰3,†,张振浩4,†,张思宇1,†,丹婷婷5,‡  
1加州大学圣地亚哥分校  
2密歇根大学安娜堡分校  
3香港科技大学(广州)  
4上海科技大学  
5北卡罗来纳大学教堂山分校  
∗共同第一作者。  
†同等贡献。  
‡通讯作者。

###### 摘要

生物医学策展将实体提及转化为评审决策。现代LLM面板可以浮现出看似合理的生物医学候选,但多模型共识表明显著性,并不能确定语料库约定的正确性。我们将面板浮现的候选验证定义为候选生成之后、面向策展人的一个层,并引入一个候选级面板输出基准,该基准将八个LLM在五个公开生物医学命名实体识别(NER)数据集上的输出对齐为候选行。我们用BioConCal实例化这一层,这是一个监督评分器,利用推理时无需金标准的面板和候选特征对候选流进行排序。在领域内文档分割中,BioConCal将AUROC从原始共识的0.753提升到0.910。在验证选择的0.95精度目标下,它选择了1,340个候选行,经验精度为0.939,而原始共识仅选择293行,Rcand=0.592且行标签Rcorpus=0.523,面板行标签上限为0.883。这些结果表明,校准后的面板证据可以将嘈杂的候选流转化为更高产出的审查队列,同时保持候选源定义可恢复宇宙的工作流边界。目标领域验证、源扩展权衡、跨度协调和人工审查仍然是下游需求。

## 1 引言

生物医学命名实体识别通常作为跨度提取进行评估。然而,在策展流程中,提取的提及成为评审决策。策展人必须决定候选是否应被接受、转交审查或拒绝。到达策展资源的假阳性可能代价高昂且难以追溯和逆转(Li等人,2016;Dogan等人,2014;Smith等人,2008;Collier and Kim,2004;Krallinger等人,2015)。现代LLM强化了这一决策点。它们可以在无需特定任务训练的情况下,根据新实体定义浮现出看似合理的生物医学候选(Singhal等人,2023;Luo等人,2022;Nagar等人,2023)。它们的输出也包括看似合理但非金标准的候选、边界变体、类型混淆和约定不匹配。核心难点不仅在于一个短语看起来是否生物医学,还在于该候选是否遵循目标语料库约定。我们使用语料库约定正确性来表示与目标数据集边界、实体类型、粒度、归一化、出现次数和注释规则的兼容性。它不代表独立的生物医学真实性验证。

多模型共识是一个明显的分诊信号。由多个模型输出的候选通常更显著。然而,显著性并不等同于语料库约定下的正确性。策展面临的问题是,是否可以对模型面板浮现的候选流进行校准和优先排序,以供策展人审查。我们将此问题称为面板浮现的候选验证。它是位于候选生成之后、人工策展之前的一个层。输入是来自定义好的模型面板的固定候选流。输出是一个面向策展人分诊的候选正确性评分。单位是一个对齐的候选行,而不是单个LLM提取器的输出。面板定义了可恢复的候选宇宙,而评分决定了该宇宙内的审查产出。因此,我们将候选级分诊与语料库级覆盖率分开。

图1说明:BioConCal概述。多模型面板首先浮现生物医学实体候选,这些候选被对齐为候选行以构建基准。BioConCal使用推理时无需金标准的面板和候选特征对这一固定候选流进行评分,然后对候选进行排序以供策展人分诊。该工作流区分了候选生成、候选级验证、验证选择操作点、跨度协调和最终人工审查。

我们通过一个候选级面板输出基准和BioConCal实例化了这一设置。该基准将八个LLM在五个公开生物医学NER数据集上的输出对齐为候选行,包含共识结构、推理时无需金标准的候选特征以及多个正确性标签。BioConCal是一个领域内监督评分器,从标记的候选行中学习。在推理时,它利用面板衍生信号和候选元数据来优先排序固定候选流以供审查。在领域内,BioConCal将AUROC从原始共识的0.753提升到0.910,并在验证选择的0.95目标下选择1,340个候选行,经验精度为0.939,而原始共识仅选择293行。我们做出四项贡献:

1. 我们定义了面板浮现的候选验证,这是一个面向策展人的问题,始于候选生成之后,询问哪些浮现的候选应优先审查。
2. 我们通过将八个LLM在五个公开生物医学NER数据集上的输出对齐为候选行,构建了一个候选级面板输出基准,包含共识结构、候选元数据、正确性标签和候选宇宙上限。
3. 我们引入了BioConCal,一个领域内监督评分器,利用推理时无需金标准的面板和候选特征来校准固定流候选,以供策展人分诊。
4. 我们分析了工作流边界,展示了共识错误、验证选择操作点、源扩展、确定性跨度协调和人工审查如何塑造部署。

## 2 基准和候选构建

该基准评估候选生成后的验证。其单位是由明确定义的面板浮现的对齐候选行。每一行代表一个可能的策展决策,而不是独立的提取器输出。

### 2.1 数据集

我们使用五个生物医学NER数据集,涵盖八种统一实体类型(化学、疾病、基因、蛋白质、DNA、RNA、细胞系、细胞类型)。表1列出了这些数据集。四个数据集构成主要基准。CHEMDNER仅作为鲁棒性分析(偏移敏感)使用,因为公共镜像未提供可靠字符偏移。对于每个数据集,我们使用固定随机种子采样500篇文档。这种固定大小设计平衡了实体模式,并使八模型面板评估可行。该基准不旨在取代完整的语料库提取器排行榜。它旨在研究共享面板协议下的候选验证。生成的基准包含2,500篇文档,每个模型在同一文档标识符上评估,共20,000次模型-文档提取调用。

| 数据集 | 实体类型 | 角色 |
|--------|----------|------|
| BC5CDR | 化学、疾病 | 主要 |
| NCBI Disease | 疾病 | 主要 |
| BC2GM | 基因 | 主要 |
| JNLPBA | 蛋白质、DNA、RNA、细胞系、细胞类型 | 主要 |
| CHEMDNER | 化学 | 仅鲁棒性 |

表1:五个生物医学NER数据集。每个为基准贡献500篇文档。

### 2.2 模型面板

面板包含八个模型。两个是封闭前沿系统(OpenAI GPT-5.5和Claude Opus 4.7),六个是本地开放权重模型,涵盖密集、MoE、指令微调和推理家族(Meta AI,2024;Yang等人,2025;DeepSeek-AI,2025;MiniMax AI,2025;Mistral AI,2025;Abdin等人,2024)。该面板被用作异构候选源,而不是单个LLM的排行榜。跨供应商和模型家族的多样性为下游评分器创造了共识和分歧结构。本地服务使用vLLM和OpenAI兼容端点。完整的面板模型表见附录表7。

### 2.3 候选主表

对于每篇文档,我们将模型预测在(normalized_text,type)键下对齐为出现级候选行。分配给同一出现槽的输出合并为一行,包含投票位图、供应商列表和表面变体。重复提及保留为单独行。如果一篇文档包含同一化学物质的四次提及,并且面板输出了两个表面变体,则候选主表保留出现级行,而不是将所有证据折叠为一个归一化字符串。这种设计匹配策展人面对的审查单位。表面变体和供应商偏移保留用于下游分析。精确跨度标签使用第一个可用的供应商偏移。offset_available_count和offset_ambiguity_count字段标记缺失或多对多的偏移证据,用于确定性跨度对齐。多集覆盖将重复候选键限制在对应的金标准出现次数内。额外的重复候选为溢出,不能增加语料库召回率。金标准注释定义训练和评估标签。它们在推理时不作为输入特征。生成的表有23,700行,是所有候选评分实验的分析单位。

#### 候选宇宙
面板定义了可恢复的候选宇宙。本文中所有候选级评分、覆盖率和选择指标均在该宇宙上计算。所有面板模型均遗漏的金标准提及仍在其外。事后评分器可以优先处理已浮现的候选,但不能选择任何源均未产生的候选。

#### 两个召回空间
BioConCal仅对已浮现的候选进行排序。因此,我们在正候选行上报告Rcand。我们还在所有语料库金标准提及上报告Rcorpus。第二个指标包括候选生成器上限,因为面板模型未浮现的金标准提及不能被评分器选择。两种上限约定区分了分诊与源比较。行标签面板上限是本文候选行标签下的最大Rcorpus,即2,124个正候选行除以2,404个金标准提及,等于0.883。更严格的多集源上限在按金标准出现次数对重复(document, type, normalized_text)键进行上限后衡量表示的金标准出现次数,LLM-8为2,057/2,404 = 0.856。我们在比较候选生成器(如BERN2)时使用更严格的上限。候选主表中缺失的已采样文档在发布样本中具有零金标准提及,因此语料库分母包括采样测试文档中的所有金标准提及,并且不会因从候选行评分中排除零候选、零金标准的文档而改变。

### 2.4 匹配变体

我们使用四种匹配变体来分离候选身份与定位敏感性。精确跨度类型在文档、实体类型、表面文本、起始和结束一致时声明预测正确。精确表面类型放弃偏移约束。归一化文本类型额外容忍大小写、空白和标点变体,是主要的候选标签。宽松重叠类型额外接受归一化文本的子串包含或同一类型的重叠偏移。BioConCal预测归一化文本类型标签。精确表面和精确跨度标签用于描述第6.1节中的下游定位敏感性。

#### 候选键控
键控分析测试基准结论是否依赖于行粒度或标签严格性。主要基准使用出现感知行和归一化文本类型标签。附录表21改变行聚合,而附录表20在候选集固定下改变正确性标签。

## 3 用于候选分诊的BioConCal

BioConCal是一个用于固定面板浮现候选行的监督评分器。对于每一行,它估计第2.4节定义的归一化文本类型标签下的正确性。分数对候选队列进行排序,以供策展人在面板定义的候选宇宙内审查。因此,BioConCal改变审查优先级,而不是候选生成或精确偏移定位。输入表示仅使用推理时可用的特征。特征分为四组:

- **共识结构**:总共识计数、封闭模型和开放模型共识计数,以及六个家族上的模型家族多样性得分。
- **提及特征**:表面长度、词元数量、文档出现次数,以及连字符、斜杠、括号、数字、希腊字母和大写缩写等的二元指示符。
- **表面可用性**:文档中精确和归一化表面的存在性,以及供应商提供偏移的计数和歧义性。
- **文档特征**:文档长度和独热实体类型。

金标准注释定义监督训练标签。源自金标准的信号(如金标准实体计数、难度分数和难度桶)被排除在输入之外以防止泄漏。完整特征列表见附录表14。我们用两个标准监督评分器实例化BioConCal。逻辑回归对标准化特征进行线性处理。梯度提升树(GBT)评分器使用带有300次迭代、学习率0.06和L2正则化0.5的HistGradientBoostingClassifier捕获非线性交互。我们还包括对原始共识计数的等渗回归作为单特征校准基线。预期校准误差(ECE)用10个等宽箱计算。校准指经验概率评分和验证选择操作点。它不是无分布精度保证。

### 3.1 训练与评估

所有训练、验证和测试分割均在文档级别进行。主要的领域内协议使用按数据集分层、种子42的60/20/20分割。我们通过检查没有(dataset,doc_id)对出现在多个分割中来断言分割完整性。检查结果保存在tables/split_integrity_check.json中。我们使用留一个数据集(LODO)协议来分离排序迁移与操作点迁移。在每一折中,BioConCal在四个主要数据集中的三个上训练,并在保留的数据集上测试。在训练池内,文档按75/25分为内部训练和内部验证。# 超越共识:为策展人分诊对面板浮现的生物医学实体候选进行评分

**来源:** https://arxiv.org/html/2605.30826

舒恒曹1,∗,陈瑞琪2,∗,曹仁杰3,†,张振浩4,†,张思宇1,†,丹婷婷5,‡  
1加州大学圣地亚哥分校  
2密歇根大学安娜堡分校  
3香港科技大学(广州)  
4上海科技大学  
5北卡罗来纳大学教堂山分校  
∗共同第一作者。  
†同等贡献。  
‡通讯作者。

###### 摘要

生物医学策展将实体提及转化为评审决策。现代LLM面板可以浮现出看似合理的生物医学候选,但多模型共识表明显著性,并不能确定语料库约定的正确性。我们将面板浮现的候选验证定义为候选生成之后、面向策展人的一个层,并引入一个候选级面板输出基准,该基准将八个LLM在五个公开生物医学命名实体识别(NER)数据集上的输出对齐为候选行。我们用BioConCal实例化这一层,这是一个监督评分器,利用推理时无需金标准的面板和候选特征对候选流进行排序。在领域内文档分割中,BioConCal将AUROC从原始共识的0.753提升到0.910。在验证选择的0.95精度目标下,它选择了1,340个候选行,经验精度为0.939,而原始共识仅选择293行,Rcand=0.592且行标签Rcorpus=0.523,面板行标签上限为0.883。这些结果表明,校准后的面板证据可以将嘈杂的候选流转化为更高产出的审查队列,同时保持候选源定义可恢复宇宙的工作流边界。目标领域验证、源扩展权衡、跨度协调和人工审查仍然是下游需求。

## 1 引言

生物医学命名实体识别通常作为跨度提取进行评估。然而,在策展流程中,提取的提及成为评审决策。策展人必须决定候选是否应被接受、转交审查或拒绝。到达策展资源的假阳性可能代价高昂且难以追溯和逆转(Li等人,2016;Dogan等人,2014;Smith等人,2008;Collier and Kim,2004;Krallinger等人,2015)。现代LLM强化了这一决策点。它们可以在无需特定任务训练的情况下,根据新实体定义浮现出看似合理的生物医学候选(Singhal等人,2023;Luo等人,2022;Nagar等人,2023)。它们的输出也包括看似合理但非金标准的候选、边界变体、类型混淆和约定不匹配。核心难点不仅在于一个短语看起来是否生物医学,还在于该候选是否遵循目标语料库约定。我们使用语料库约定正确性来表示与目标数据集边界、实体类型、粒度、归一化、出现次数和注释规则的兼容性。它不代表独立的生物医学真实性验证。

多模型共识是一个明显的分诊信号。由多个模型输出的候选通常更显著。然而,显著性并不等同于语料库约定下的正确性。策展面临的问题是,是否可以对模型面板浮现的候选流进行校准和优先排序,以供策展人审查。我们将此问题称为面板浮现的候选验证。它是位于候选生成之后、人工策展之前的一个层。输入是来自定义好的模型面板的固定候选流。输出是一个面向策展人分诊的候选正确性评分。单位是一个对齐的候选行,而不是单个LLM提取器的输出。面板定义了可恢复的候选宇宙,而评分决定了该宇宙内的审查产出。因此,我们将候选级分诊与语料库级覆盖率分开。

图1说明:BioConCal概述。多模型面板首先浮现生物医学实体候选,这些候选被对齐为候选行以构建基准。BioConCal使用推理时无需金标准的面板和候选特征对这一固定候选流进行评分,然后对候选进行排序以供策展人分诊。该工作流区分了候选生成、候选级验证、验证选择操作点、跨度协调和最终人工审查。

我们通过一个候选级面板输出基准和BioConCal实例化了这一设置。该基准将八个LLM在五个公开生物医学NER数据集上的输出对齐为候选行,包含共识结构、推理时无需金标准的候选特征以及多个正确性标签。BioConCal是一个领域内监督评分器,从标记的候选行中学习。在推理时,它利用面板衍生信号和候选元数据来优先排序固定候选流以供审查。在领域内,BioConCal将AUROC从原始共识的0.753提升到0.910,并在验证选择的0.95目标下选择1,340个候选行,经验精度为0.939,而原始共识仅选择293行。我们做出四项贡献:

1. 我们定义了面板浮现的候选验证,这是一个面向策展人的问题,始于候选生成之后,询问哪些浮现的候选应优先审查。
2. 我们通过将八个LLM在五个公开生物医学NER数据集上的输出对齐为候选行,构建了一个候选级面板输出基准,包含共识结构、候选元数据、正确性标签和候选宇宙上限。
3. 我们引入了BioConCal,一个领域内监督评分器,利用推理时无需金标准的面板和候选特征来校准固定流候选,以供策展人分诊。
4. 我们分析了工作流边界,展示了共识错误、验证选择操作点、源扩展、确定性跨度协调和人工审查如何塑造部署。

## 2 基准和候选构建

该基准评估候选生成后的验证。其单位是由明确定义的面板浮现的对齐候选行。每一行代表一个可能的策展决策,而不是独立的提取器输出。

### 2.1 数据集

我们使用五个生物医学NER数据集,涵盖八种统一实体类型(化学、疾病、基因、蛋白质、DNA、RNA、细胞系、细胞类型)。表1列出了这些数据集。四个数据集构成主要基准。CHEMDNER仅作为鲁棒性分析(偏移敏感)使用,因为公共镜像未提供可靠字符偏移。对于每个数据集,我们使用固定随机种子采样500篇文档。这种固定大小设计平衡了实体模式,并使八模型面板评估可行。该基准不旨在取代完整的语料库提取器排行榜。它旨在研究共享面板协议下的候选验证。生成的基准包含2,500篇文档,每个模型在同一文档标识符上评估,共20,000次模型-文档提取调用。

| 数据集 | 实体类型 | 角色 |
|--------|----------|------|
| BC5CDR | 化学、疾病 | 主要 |
| NCBI Disease | 疾病 | 主要 |
| BC2GM | 基因 | 主要 |
| JNLPBA | 蛋白质、DNA、RNA、细胞系、细胞类型 | 主要 |
| CHEMDNER | 化学 | 仅鲁棒性 |

表1:五个生物医学NER数据集。每个为基准贡献500篇文档。

### 2.2 模型面板

面板包含八个模型。两个是封闭前沿系统(OpenAI GPT-5.5和Claude Opus 4.7),六个是本地开放权重模型,涵盖密集、MoE、指令微调和推理家族(Meta AI,2024;Yang等人,2025;DeepSeek-AI,2025;MiniMax AI,2025;Mistral AI,2025;Abdin等人,2024)。该面板被用作异构候选源,而不是单个LLM的排行榜。跨供应商和模型家族的多样性为下游评分器创造了共识和分歧结构。本地服务使用vLLM和OpenAI兼容端点。完整的面板模型表见附录表7。

### 2.3 候选主表

对于每篇文档,我们将模型预测在(normalized_text,type)键下对齐为出现级候选行。分配给同一出现槽的输出合并为一行,包含投票位图、供应商列表和表面变体。重复提及保留为单独行。如果一篇文档包含同一化学物质的四次提及,并且面板输出了两个表面变体,则候选主表保留出现级行,而不是将所有证据折叠为一个归一化字符串。这种设计匹配策展人面对的审查单位。表面变体和供应商偏移保留用于下游分析。精确跨度标签使用第一个可用的供应商偏移。offset_available_count和offset_ambiguity_count字段标记缺失或多对多的偏移证据,用于确定性跨度对齐。多集覆盖将重复候选键限制在对应的金标准出现次数内。额外的重复候选为溢出,不能增加语料库召回率。金标准注释定义训练和评估标签。它们在推理时不作为输入特征。生成的表有23,700行,是所有候选评分实验的分析单位。

#### 候选宇宙
面板定义了可恢复的候选宇宙。本文中所有候选级评分、覆盖率和选择指标均在该宇宙上计算。所有面板模型均遗漏的金标准提及仍在其外。事后评分器可以优先处理已浮现的候选,但不能选择任何源均未产生的候选。

#### 两个召回空间
BioConCal仅对已浮现的候选进行排序。因此,我们在正候选行上报告Rcand。我们还在所有语料库金标准提及上报告Rcorpus。第二个指标包括候选生成器上限,因为面板模型未浮现的金标准提及不能被评分器选择。两种上限约定区分了分诊与源比较。行标签面板上限是本文候选行标签下的最大Rcorpus,即2,124个正候选行除以2,404个金标准提及,等于0.883。更严格的多集源上限在按金标准出现次数对重复(document, type, normalized_text)键进行上限后衡量表示的金标准出现次数,LLM-8为2,057/2,404 = 0.856。我们在比较候选生成器(如BERN2)时使用更严格的上限。候选主表中缺失的已采样文档在发布样本中具有零金标准提及,因此语料库分母包括采样测试文档中的所有金标准提及,并且不会因从候选行评分中排除零候选、零金标准的文档而改变。

### 2.4 匹配变体

我们使用四种匹配变体来分离候选身份与定位敏感性。精确跨度类型在文档、实体类型、表面文本、起始和结束一致时声明预测正确。精确表面类型放弃偏移约束。归一化文本类型额外容忍大小写、空白和标点变体,是主要的候选标签。宽松重叠类型额外接受归一化文本的子串包含或同一类型的重叠偏移。BioConCal预测归一化文本类型标签。精确表面和精确跨度标签用于描述第6.1节中的下游定位敏感性。

#### 候选键控
键控分析测试基准结论是否依赖于行粒度或标签严格性。主要基准使用出现感知行和归一化文本类型标签。附录表21改变行聚合,而附录表20在候选集固定下改变正确性标签。

## 3 用于候选分诊的BioConCal

BioConCal是一个用于固定面板浮现候选行的监督评分器。对于每一行,它估计第2.4节定义的归一化文本类型标签下的正确性。分数对候选队列进行排序,以供策展人在面板定义的候选宇宙内审查。因此,BioConCal改变审查优先级,而不是候选生成或精确偏移定位。输入表示仅使用推理时可用的特征。特征分为四组:

- **共识结构**:总共识计数、封闭模型和开放模型共识计数,以及六个家族上的模型家族多样性得分。
- **提及特征**:表面长度、词元数量、文档出现次数,以及连字符、斜杠、括号、数字、希腊字母和大写缩写等的二元指示符。
- **表面可用性**:文档中精确和归一化表面的存在性,以及供应商提供偏移的计数和歧义性。
- **文档特征**:文档长度和独热实体类型。

金标准注释定义监督训练标签。源自金标准的信号(如金标准实体计数、难度分数和难度桶)被排除在输入之外以防止泄漏。完整特征列表见附录表14。我们用两个标准监督评分器实例化BioConCal。逻辑回归对标准化特征进行线性处理。梯度提升树(GBT)评分器使用带有300次迭代、学习率0.06和L2正则化0.5的HistGradientBoostingClassifier捕获非线性交互。我们还包括对原始共识计数的等渗回归作为单特征校准基线。预期校准误差(ECE)用10个等宽箱计算。校准指经验概率评分和验证选择操作点。它不是无分布精度保证。

### 3.1 训练与评估

所有训练、验证和测试分割均在文档级别进行。主要的领域内协议使用按数据集分层、种子42的60/20/20分割。我们通过检查没有(dataset,doc_id)对出现在多个分割中来断言分割完整性。检查结果保存在tables/split_integrity_check.json中。我们使用留一个数据集(LODO)协议来分离排序迁移与操作点迁移。在每一折中,BioConCal在四个主要数据集中的三个上训练,并在保留的数据集上测试。在训练池内,文档按75/25分为内部训练和内部验证。

相似文章

从投票到智能体协作:面向答案类型的BioASQ 14b大语言模型流水线

arXiv cs.CL

本文针对BioASQ 14b Task B生物医学问答挑战,提出了一种问题类型特定的大语言模型框架。该框架对是非题、事实题和列表题分别采用不同的推理策略(片段打乱、思维链、多智能体协作),取得了具有竞争力的结果,包括在第四批次的事实题子任务中获得第一名。