CAFE:一种复合AI因子评估框架

arXiv cs.CL 论文

摘要

CAFE是一个开源平台,应用实验设计原则来评估复合AI系统,通过因子设计和混合效应模型将答案质量差异归因于组件及其交互作用。

arXiv:2607.10380v1 公告类型:新论文 摘要:我们介绍了CAFE(复合AI因子评估),这是一个开源平台,将实验设计引入复合AI系统(CAIS)的评估中。此类系统暴露了许多可互换的选择——例如,使用哪个检索器、模型或提示——实践者很少知道哪个对答案质量影响最大。使用CAFE,实践者将流水线的每个可替换组件注册为一个因子,构建所选因子上的因子设计,运行所得配置,并使用可配置的LLM评判器结合人工评分员,按照共享评估标准对答案进行评分。从这些评分中,它通过混合效应模型将答案质量方差归因于组件及其交互作用,并报告效应大小、显著性、最佳配置、成本和延迟权衡,以及评判者与人工的可靠性。现有工具大多要么搜索一个好的配置,要么单独评估输出,而CAFE还解释了哪个组件驱动了质量,以及观察到的差异是否显著。我们在HotpotQA基准数据集上的检索增强问答(QA)流水线上验证了CAFE,它能够恢复植入的因子效应,并在置换零假设下保持校准。CAFE以Python包和Web应用程序的形式发布。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:21

# CAFE:一个复合人工智能析因评估框架

来源:https://arxiv.org/html/2607.10380

Fabian Lukassen¹,Christoph Weisser²,Thomas Kneib¹,Alexander Silbersdorff¹

¹哥廷根大学,²比勒费尔德应用科学大学 (HSBI)

[email protected][email protected][email protected][email protected]

###### 摘要

我们提出CAFE(复合人工智能析因评估),一个开源平台,将*实验设计*引入复合人工智能系统(CAIS)的评估。此类系统存在许多可互换的选择——例如使用哪个检索器、模型或提示——而从业者通常不清楚哪一个对答案质量影响最大。使用CAFE,从业者将流水线的每个可替换组件注册为一个因子,构建所选因子上的析因设计,运行生成的配置,并使用可配置的LLM评审员与人类评分者一起,根据共享评分标准对答案进行评分。通过这些评分,它使用混合效应模型将答案质量方差归因于组件及其交互,并报告效应量、显著性、最佳配置、成本与延迟权衡,以及评审员与人类之间的可靠性。现有工具大多要么*搜索*一个好的配置,要么*孤立*地对输出进行评分,而CAFE还*解释*哪个组件驱动质量,以及观察到的差异是否显著。我们在HotpotQA基准数据集上的检索增强问答(QA)流水线上验证了CAFE,它能够恢复植入的因子效应,并在置换零假设下保持校准。CAFE作为Python包和Web应用程序发布。

CAFE:一个复合人工智能析因评估框架††

登陆页面:https://cafe-ai.de/
演示:https://cafe-ai.de/demo
代码:https://github.com/fabian-lu/Cafe
文档:https://fabian-lu.github.io/Cafe

## 1 引言

现代AI应用程序很少依赖单一语言模型。当前主导模式是*复合人工智能系统*(Zaharia et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib1);Chen et al., 2025a (https://arxiv.org/html/2607.10380#bib.bib2)):一种通过多个交互组件(如检索、重排序、上下文组装、提示、一个或多个模型调用、工具使用和防护措施)来解决任务的应用程序。每个组件可以由几种竞争性技术实现:仅检索可能包括稀疏关键词搜索、密集嵌入检索或重排序流水线;任何其他组件也可以同样自由地替换。由于这些离散的、通常是不可微的选择组合在一起,即使是一个简单的流水线也会产生一个大型的组合候选*配置*空间。

日益增长的文献帮助从业者*构建*和*优化*此类流水线,从声明式编程模型(Khattab et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib4))到端到端配置搜索(Kartal et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib25);Lee et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib3))。然而,选择哪个配置上线会引发优化器只能间接回答的问题。假设一个检索增强助手的构建者可以在三个基础模型、两个检索语料库和三个提示之间选择:总共18个候选配置。从业者的直接目标是单一性能最优的配置,CAFE会直接报告;但一个可信、可操作的决策依赖于两个相互关联的问题。首先,*哪个组件驱动答案质量,以及精力应该花在哪里?* 团队的时间是有限的,下一个改进是应该来自工程化提示还是构建更强的检索流水线,这一点至关重要。组件之间也会交互,通常是非单调的——更强的模型可能只在检索质量好时才有帮助,而添加模型调用可能帮助某些查询但损害其他查询(Chen et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib7))——因此孤立的视角由于忽略这些交互而有可能错误衡量系统。其次,*观察到的差异是否显著?* 两个配置之间的差距可能是偶然的伪迹而非真实效应,比较每个配置单次运行的平均得分无法区分两者。优化器返回得分最高的配置,但无法提供关于它*为什么*获胜或*是否*差距可信的校准说明。为了解决这些问题,CAFE采用了*实验设计*(DoE)和混合效应模型(Fisher, 1935 (https://arxiv.org/html/2607.10380#bib.bib34);Montgomery, 2017 (https://arxiv.org/html/2607.10380#bib.bib35);Pinheiro and Bates, 2000 (https://arxiv.org/html/2607.10380#bib.bib36))。析因设计从一组平衡的运行中估计每个组件的效应*以及*组件之间的交互;通过复制运行并使用随机效应对结果建模,将真实差异与噪声以及某些输入天生更难这一事实区分开来。然而,目前还没有一个可用的系统将这种方法打包给构建复合AI流水线的人。

CAFE是一个开源评估框架,有四个贡献:(i) **流水线即因子抽象**,将任何可替换的组件暴露为一个*因子*,其替代实现成为*水平*;(ii) **设计与执行引擎**,在所选因子上构建析因设计,针对目标系统运行每个配置;(iii) **双重评分工作流**,其中相同的答案由完全可配置的LLM评审员和人类根据共享评分标准进行评分,并报告两者之间的评分者间信度;(iv) **方差归因层**,拟合与评分尺度匹配的混合效应模型,报告每个组件和交互对结果贡献的效应量和显著性,并识别最佳配置。CAFE作为开源早期阶段**Python包**(https://github.com/fabian-lu/Cafe)(基于Apache 2.0许可)发布,并配有配套的Web应用程序(Web界面截图见附录A (https://arxiv.org/html/2607.10380#A1));我们还提供了**示例笔记本**(https://fabian-lu.github.io/Cafe/notebooks/01_quickstart/)用于系统演示。该项目欢迎任何**贡献**(https://github.com/fabian-lu/Cafe/blob/main/CONTRIBUTING.md),**路线图**(https://cafe-ai.de/roadmap.html)列出了计划的功能,其中一部分我们也在第6节(https://arxiv.org/html/2607.10380#S6)中强调。

表1:CAFE与代表性系统的对比。

## 2 相关工作

CAIS的评估涉及三条研究路线:*优化*流水线的工具、*评分*其输出的工具,以及AI评估的统计学方法。表1(https://arxiv.org/html/2607.10380#S1.T1)将CAFE与代表性评估系统进行了对比。

#### 优化复合系统。
一条研究路线*搜索*配置空间以找到高评分的流水线:DSPy编译和调优声明式流水线(Khattab et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib4)),TextGrad反向传播文本反馈(Yuksekgonul et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib5)),LLMSelector将模型分配给模块(Chen et al., 2025b (https://arxiv.org/html/2607.10380#bib.bib6)),Optimas将局部奖励与全局性能对齐(Wu et al., 2026 (https://arxiv.org/html/2607.10380#bib.bib9)),RAGSmith和多目标搜索探索大规模RAG空间(Kartal et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib25);Barker et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib8))。

#### 评估框架与工具。
整体基准如HELM(Liang et al., 2023 (https://arxiv.org/html/2607.10380#bib.bib15))描述的是*模型*在不同场景下的表现,而非*流水线*在组件选择上的表现。指标库使用LLM评审员对流水线输出进行评分:RAGAS(Es et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib13))和ARES(Saad-Falcon et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib14)),后者添加了预测驱动的置信区间(Fisch et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib51)),以及DeepEval(Confident AI, 2024 (https://arxiv.org/html/2607.10380#bib.bib22)),一个pytest风格的框架,提供G-Eval(Liu et al., 2023 (https://arxiv.org/html/2607.10380#bib.bib24))和组件级指标,还有TruLens(TruEra, 2024 (https://arxiv.org/html/2607.10380#bib.bib23)),它计算执行轨迹上的反馈函数。执行和标注平台(LangSmith(LangChain, 2024 (https://arxiv.org/html/2607.10380#bib.bib19))、Inspect AI(UK AI Security Institute, 2024 (https://arxiv.org/html/2607.10380#bib.bib17))和Argilla(Argilla, 2024 (https://arxiv.org/html/2607.10380#bib.bib18)))提供运行框架、评审员评分和人工标注队列。

#### AI评估的统计学方法。
越来越多的文献通过统计推断的视角看待评估:量化基准不确定性(Wang et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib63))、层次贝叶斯建模(Luettgau et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib53))、LLM流水线中的测量误差(Messing, 2026 (https://arxiv.org/html/2607.10380#bib.bib55)),以及用于评分标准的序数而非区间模型(Howcroft and Rieser, 2021 (https://arxiv.org/html/2607.10380#bib.bib39);Taylor et al., 2023 (https://arxiv.org/html/2607.10380#bib.bib41);Syiem and Velloso, 2026 (https://arxiv.org/html/2607.10380#bib.bib40));基于方差的敏感性分析是将输出方差归因于输入的标准工具(Saltelli et al., 2008 (https://arxiv.org/html/2607.10380#bib.bib32))。最接近的两项工作是Haase et al.(2026 (https://arxiv.org/html/2607.10380#bib.bib26)),他们将输出方差分解为提示、模型和采样成分,但仅针对独立的创意生成,使用线性模型和单个自动评分者;以及Mustahsan et al.(2025 (https://arxiv.org/html/2607.10380#bib.bib59)),他们用一个单一的组内相关系数总结运行间的不一致性;两者均未将方差归因于跨越整个流水线的设计的析因。最近的工作还将复合系统中的故障或扰动归因到具体组件(Chowdhury and D'Souza, 2026 (https://arxiv.org/html/2607.10380#bib.bib27);Nilayam and Nayak, 2026 (https://arxiv.org/html/2607.10380#bib.bib28)),而平行的工作校准和审计LLM评审员(Gu et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib56);Han et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib57);Boyeau et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib50);Park et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib52);Dubois et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib54);Guerdan et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib58)),并记录驱动复现的非确定性(Atil et al., 2024 (https://arxiv.org/html/2607.10380#bib.bib60);Haldar and Hockenmaier, 2025 (https://arxiv.org/html/2607.10380#bib.bib62);Bjarnason et al., 2026 (https://arxiv.org/html/2607.10380#bib.bib61))。LLM输出的析因研究开始出现(Vazquez et al., 2025 (https://arxiv.org/html/2607.10380#bib.bib33);Lukassen et al., 2026 (https://arxiv.org/html/2607.10380#bib.bib31))。

#### 现有空白。
没有现有系统能够结合这些线索(表1(https://arxiv.org/html/2607.10380#S1.T1))。优化器返回评分最高的配置,但不提供关于它*为什么*最好的校准说明。指标库和执行平台对输出评分并收集评分,但将实验设计和统计分析留给用户。上述统计方法直接相关,但尚未打包成可用工具。第3节(https://arxiv.org/html/2607.10380#S3)现在描述CAFE如何将这个空白操作化成一个框架。

## 3 CAFE框架

(图1:CAFE架构。)

CAFE将CAIS中的选择转化为实验*因子*(图1(https://arxiv.org/html/2607.10380#S3.F1))。一项研究变化因子F₁,...,Fₚ,每个因子在有限*水平*集合Lᵢ上取值;每个因子选择一个水平得到一个*配置* c = (c₁,...,cₚ) ∈ C = L₁×⋯×Lₚ,*全因子*就是整个笛卡尔积。在输入x ∈ X上运行c产生输出Run(c,x),通过评分标准映射到质量评分Y;由于系统和评审员是非确定性的,Y是一个随机变量,因为相同的c在不同运行中可能得分不同。

两种选择成为因子:*哪个组件*执行一个步骤——例如检索器,水平为none, dense, dense_rerank——以及组件的*参数*,如解码温度。当在CAFE内部构建流水线时,这些因子从其结构中读出:系统是一个有序的*阶段*序列s₁,...,sₘ(每个阶段是一个进行选择的位置),为一个阶段sₖ注册的*技术*是该阶段因子的水平,而技术的可调参数sₖ.p(例如retrieve.top_k)是一个进一步的因子。

给定因子和输入,CAFE将第1节(https://arxiv.org/html/2607.10380#S1)中的问题转化为Y上的估计问题:*归因*——每个因子Fᵢ及每个交互解释Y的变异量;*选择*——配置argmax_c E[Y|c];以及两者的*显著性*,在Run运行间变异下具有有效的不确定性。算法1(https://arxiv.org/html/2607.10380#alg1)形式化了这个过程。我们依次描述每个部分。

**算法1** CAFE研究

1: 声明因子 F₁,...,Fₚ 及其水平 L₁,...,Lₚ  
2: C ← L₁×⋯×Lₚ  ▷ 全因子:每个配置  
3: for all 配置 c ∈ C, 输入 x ∈ X, 复制 r do  
4:   a_{cxr} ← Run(c,x)  ▷ 执行;并发受限,可恢复  
5:   y_{cxr} ← Rate(a_{cxr})  ▷ LLM评审员和/或人类,共享评分标准  
6: end for  
7: 拟合与评分标准尺度匹配的模型(CLMM / 逻辑回归 / 线性模型)  
8: 归因方差;报告效应量、显著性、最佳配置、成本前沿和α

### 3.1 定义系统

CAFE支持两种方式提供算法1中的Run。常见情况下,流水线在CAFE*内部组成*:每个技术通过一行装饰器注册到其阶段,编排函数将各阶段连接起来(列表1(https://arxiv.org/html/2607.10380#LST1))。然后CAFE让每个因子在其水平上变化,并且由于它执行流水线,无需额外连接即可记录每阶段延迟和美元成本。因子的一个水平可以是None,告诉CAFE完全跳过该阶段,因此组件可以打开和关闭(例如,使用或不使用重排序器)。

或者,无法或无需检测的系统——例如外部HTTP端点——作为*黑盒*驱动:任何可调用的run(config, item)都是一个系统——CAFE向其传递配置和输入,可调用对象从config中读取每个因子的选定水平——其因子直接声明。黑盒模式仅放弃每阶段的延迟和成本明细,保留设计、评分和方差归因不变。

```python
import cafe
pipe = cafe.Pipeline()

@pipe.technique(stage="retrieve", name="none")
async def retrieve_none(ctx, query):
    return []

@pipe.technique(stage="retrieve", name="dense", cost_usd=...)

相似文章

BEAMS: AI在建模与仿真中的基准测试与评估

arXiv cs.AI

BEAMS倡议提出了一套基准测试集,用于评估建模与仿真中的AI工具,重点关注以人为本和负责任的AI实践。测试显示,基于LLM的引擎存在差异,在定性任务上的表现优于因果推理。

CausaLab: 面向AI科学家的可扩展交互式因果发现环境

Hugging Face Daily Papers

CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。

Evaluation Cards: 一种AI评估报告的解释层

Hugging Face Daily Papers

本文介绍了EvalCards,这是一种操作框架,通过将基准元数据、评估运行数据和模型元数据组合成一个统一记录,并包含可重现性、完整性、来源、风险和分数可比性的解释性信号,从而标准化AI评估报告。作者在数千个模型和基准测试中部署了一个监控工具,揭示了当前报告实践中的系统性差距。