面向AI时代的营养数据基础设施:为智能体介导的研究实现FAIR可操作化

arXiv cs.AI 论文

摘要

本文介绍了营养数据服务(NDS),这是一种保留来源的基础设施,将FAIR原则付诸实践,用于AI智能体介导的营养研究,解决了数据身份、搜索和交叉映射的挑战。与开放网络重建相比,它展示了强大的基准测试结果和更高的可重复性。

arXiv:2608.10363v1 公告类型:新 摘要:AI智能体可以加速营养研究,但其分析继承了底层数据的身份、语义和发布歧义。我们提出了营养数据服务(NDS),这是一种保留来源的基础设施,将FAIR原则操作化以实现自动化使用:描述解析使特定发布记录可被发现;类型化交叉映射连接独立发布的资源;机器可读接口暴露带版本的数据源和交叉映射,使AI智能体的分析可重播和可审计。在食品描述基准测试中,NDS表现出强大的留出准确度,并优于NutriBench上已发表的最佳语言模型结果。外部和盲法交叉映射评估表明,其类型化契约有利于可辩护的链接,并拒绝不支持映射。在个体层面的升糖指数分析中,固定的NDS输入在模型和重复运行中产生相同的输出,而开放网络重建仍然不稳定。核心结论是,智能体介导的营养研究需要新的数据基础设施来支持数据身份、搜索和交叉映射。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:23

# 面向AI时代的营养数据基础设施:为智能体介导的研究落地FAIR原则
来源:https://arxiv.org/html/2608.10363
###### 摘要

AI智能体可以加速营养研究,但其分析继承了底层数据的身份、语义和版本歧义。我们提出了营养数据服务(NDS),一种保留数据源的基础设施,将FAIR原则落地为自动化使用:描述解析使特定发布版本的记录可发现;类型化交叉映射连接独立发布的资源;机器可读接口暴露版本化的来源和交叉映射,使AI智能体的工作可重放且可审计。在食物描述基准测试中,NDS表现出很强的留出集准确率,并优于NutriBench上已发表的最佳语言模型结果。外部和盲法交叉映射评估表明,其类型化契约有利于可辩护的链接,并拒绝不支持的映射。在个体层面血糖指数分析中,固定的NDS输入在不同模型和重复运行中产生相同输出,而开放网络重建仍然不稳定。核心结论是,智能体介导的营养研究需要新的数据基础设施来处理数据身份、搜索和交叉映射。

## 1 引言

AI智能体能够检索文献、操作研究工具、编写并执行分析代码,并跨来源整合证据。我们用*智能体介导的研究*指代一种由人类指导的工作流程,其中智能体执行有界操作——查找证据、协调数据集、运行分析并记录产物——而研究者设定问题、约束和科学解释[21](https://arxiv.org/html/2608.10363#bib.bib21)。其前景不仅仅是更快的答案,而是从假设到可审计敏感性分析的更短路径。

营养学使这一机遇和约束都格外清晰。一项研究可能跨越食物成分表、膳食调查、品牌产品目录、价格、生物标志物和健康结局。智能体不仅要检索一个合理的营养素数值;它还必须选择预期的食物记录,保留其来源和发布版本,解读分析基础,并进行可审计的跨源连接。检索接地减少了对参数记忆的依赖,但它无法修复证据本身中的模糊标识符或缺失上下文[13](https://arxiv.org/html/2608.10363#bib.bib13)、[11](https://arxiv.org/html/2608.10363#bib.bib11)。

当前的食物数据格局使这些失败很可能发生。一项对覆盖110个国家的101个食物成分数据库的评估发现,只有32%提供API,只有17个满足FAIR原则全部13项评估标准(可发现、可访问、可互操作、可重用)[4](https://arxiv.org/html/2608.10363#bib.bib4)。该综述还报告,对于相同饮食,营养素摄入估计可能因所选数据库不同而相差20–45%[4](https://arxiv.org/html/2608.10363#bib.bib4)。互操作性尤其困难,因为没有一个数据库能独自提供它[14](https://arxiv.org/html/2608.10363#bib.bib14)、[10](https://arxiv.org/html/2608.10363#bib.bib10)。食物来源很少共享稳定标识符,而名称随地域、物种、制备方式、可食部分、加工方式、品牌和数据库目的而变化。字符串连接可能无声地混淆营养学上不同的食物;将来源展平为一个表可能抹去用于发现错误的发布历史和解析语义。连接独立发布的来源反而需要显式映射断言:哪些记录相关,通过什么关系,依据什么证据和置信度,在哪个端点版本下,并且在不存在可辩护链接时给出显式的不支持结果。因此,描述驱动的食物匹配不是叠加在基础设施上的应用;它正是使原本互不连接来源得以互操作的机制。

因此,我们将FAIR作为需求词汇表。AI并未重新定义FAIR;它提高了充分实施的标准。一个细心的研究者可能从文档中恢复的上下文必须可机器操作,并且模糊的连接必须显式失败,而不是在查询时临时凑合。

我们提出营养数据服务(NDS),一种面向这些需求构建的保留数据源基础设施。NDS保留独立可寻址的来源记录和营养素观测;通过混合检索、上下文排序和弃权来解析自然语言描述;在不折叠端点的情况下构建可审计的交叉映射;并通过REST、批量导出和Model Context Protocol(MCP)工具暴露结构化数据。

我们做出三项贡献。(1)基础设施:一个已部署的数据模型和访问层,保留来源身份、发布版本、营养素语义和存储的谱系。(2)解析与交叉映射:一个共享的描述驱动流水线,用于自然语言查找和跨源映射,在从膳食研究食品与营养素数据库(FNDDS)到血糖指数(GI)记录的已部署交叉映射中得以验证。(3)评估:对记录解析、端到端营养素估计、开放集对齐、交叉映射质量和可复现智能体使用的测试,并以来源协调作为支持性验证。

[第2节](https://arxiv.org/html/2608.10363#S2)讨论相关工作;[第3节](https://arxiv.org/html/2608.10363#S3)推导AI时代FAIR标准;[第4节](https://arxiv.org/html/2608.10363#S4)描述系统;[第5节](https://arxiv.org/html/2608.10363#S5)和[第6节](https://arxiv.org/html/2608.10363#S6)报告证据及其局限。

## 2 相关工作

#### 食物成分数据与协调。

食物成分数据库是营养科学的基础,然而其碎片化和不均衡的管理已被充分记录。全球评估发现更新不频繁、二级数据广泛复用,以及FAIR采纳存在地域差异[4](https://arxiv.org/html/2608.10363#bib.bib4);已发表的研究也常常省略可复现性所需的数据库版本[14](https://arxiv.org/html/2608.10363#bib.bib14)。在成分、价格、环境和地理空间来源之间,交叉映射很少[10](https://arxiv.org/html/2608.10363#bib.bib10)。EuroFIR和新兴的最小信息标准在编译时处理协调问题[18](https://arxiv.org/html/2608.10363#bib.bib18)、[3](https://arxiv.org/html/2608.10363#bib.bib3)。我们转而连接未采纳共同标准的独立发布的成分、调查和品牌食物来源[7](https://arxiv.org/html/2608.10363#bib.bib7)。

#### 食物语义与映射标准。

FoodOn将LanguaL的大部分词汇转化为OWL本体,并在食品、原料、品质和过程之间建立显式关系[6](https://arxiv.org/html/2608.10363#bib.bib6)。共享本体映射的简单标准(SSSOM)提供了一种互补模式,用于交换带有类型化关系、理由、来源和置信度元数据的映射[15](https://arxiv.org/html/2608.10363#bib.bib15)。这些标准使食物和映射更可机器读取,但不决定应断言哪些记录级映射、何时弃权,或如何在来源版本变化时维护映射。

#### 食物记录匹配。

先前系统使用模糊距离、嵌入和大语言模型(LLMs)来映射食物描述。Morales-Garzón等人[17](https://arxiv.org/html/2608.10363#bib.bib17)表明,一条描述在多个特异性层级上可能存在可辩护的候选。NutriBench评估从餐食描述中估计碳水化合物的任务[5](https://arxiv.org/html/2608.10363#bib.bib5)。Lemay等人[12](https://arxiv.org/html/2608.10363#bib.bib12)将弃权作为一等结果,并表明相似性阈值不能干净地区分匹配与非匹配。NutriMatch[9](https://arxiv.org/html/2608.10363#bib.bib9)结合LLM归一化、嵌入检索和LLM验证,以扩展跨国家数据库的营养素覆盖。这些系统激发了我们聚焦于作为基础设施的匹配:不仅选择记录,还要发布审计或重放该选择所需的关系、证据、发布范围与弃权。

#### 大语言模型作为营养访问层。

NGQA等基准现在测试对美国国家健康与营养调查(NHANES)档案和FNDDS食物的个性化推理[22](https://arxiv.org/html/2608.10363#bib.bib22)。LLM也在被评估为遵循指南的营养信息的直接界面[19](https://arxiv.org/html/2608.10363#bib.bib19),这提高了将答案锚定在版本化、保留数据源数据中的重要性。然而,模型答案难以引用或重放,并且仍然容易产生幻觉[11](https://arxiv.org/html/2608.10363#bib.bib11)。检索接地[13](https://arxiv.org/html/2608.10363#bib.bib13)仅在界面保留其返回证据的来源、发布版本和映射上下文时才有帮助。

## 3 AI时代的FAIR原则

FAIR面向人类研究者和计算智能体。它描述了数字研究对象的属性——包括数据、元数据、算法和工作流——而不规定存储或搜索架构[20](https://arxiv.org/html/2608.10363#bib.bib20)。因此,应用它需要特定领域的解释[8](https://arxiv.org/html/2608.10363#bib.bib8)。

对于智能体介导的营养研究,相关对象从数据集发布版本到记录、值或映射不等。表1列出了本文使用的标准和相应的NDS机制。

表1:面向智能体介导营养研究的FAIR标准与NDS机制。

## 4 系统

### 4.1 架构

参见图1说明:营养数据服务(NDS)分离权威来源存储、可重建检索索引,以及面向AI智能体和应用的访问。图1展示了NDS的高层架构。离线索引从来源描述构建搜索索引。在线请求使用该索引检索并重新排序候选,然后通过MCP或REST暴露选中的来源记录。MCP是一种开放协议,智能体通过它发现并调用命名的外部工具[1](https://arxiv.org/html/2608.10363#bib.bib

相似文章

科学AI的自动化数据就绪

arXiv cs.AI

本文介绍了REDI,这是一个开源框架,通过统一的五阶段流水线(摄取、预处理、转换、结构化、输出)将原始科学数据集自动转换为AI就绪数据,并配有配套工具SetGo以实现FAIR合规性,在多个科学领域进行了评估。

智能体数据

Hugging Face Blog

NVIDIA 讨论了开放数据和合成数据对于构建稳健 AI 智能体的重要性,并重点介绍了他们用于训练、推理和工具使用的 Nemotron 开放数据集。

FAM-Bench: 面向条件感知的食品即药物推理的多模态基准

arXiv cs.AI

介绍了FAM-Bench,这是一个多模态基准,包含2500个经专家验证的实例,涵盖13种与饮食相关的健康状况,旨在评估AI模型评估菜肴对特定健康状况的适宜性的能力,超越了基本的食物识别,转向条件感知推理。

新AI模型找到更便宜的健康饮食之路

Reddit r/artificial

加州大学戴维斯分校的研究人员开发了一种AI模型,建议进行小的食材替换来改善营养,并降低多达34%的餐食成本,据《PLOS数字健康》报道。