大型语言模型在化妆品化学与皮肤健康中的准确性与可靠性:一项基准研究

arXiv cs.AI 论文

摘要

本研究对14个大型语言模型在化妆品化学与皮肤健康主题上进行了基准测试,发现其准确性和可靠性较差,尤其在技术性和量化任务中。研究得出结论,当前通用型LLM在未经过进一步微调和算法改进的情况下,无法为知情的消费者决策提供可靠信息。

arXiv:2608.14631v1 公告类型:新 摘要:随着消费者越来越多地转向AI聊天机器人寻求护肤建议,大型语言模型(LLM)在化妆品化学方面的技术准确性在很大程度上尚未得到评估。我们对14个LLM在与化妆品化学相关的结构化主题集上进行了基准测试,包括特定化妆品成分的化学属性以及消费者可能感兴趣的常见化妆品场景。在整个评估过程中禁用了网络搜索,以评估每个模型的内化知识而非其互联网检索能力。总体表现较差,在量化推理和结构识别任务中的缺陷最为明显。虽然模型在处理一般性护肤问题时表现合理,但回答始终缺乏做出知情消费者决策所需的技术深度。值得注意的是,与AI的对话可能存在风险:听起来权威但包含技术错误的输出,与明确承认不确定性的回答相比,更不容易引发怀疑。这些发现表明,主要基于未经验证的公共数据训练的通用型LLM,目前并不是化妆品化学信息的可靠来源。在两个方面取得进展——对经过验证的化学和皮肤病学数据集进行微调,以及对算法推理的显著改进——可能在这些工具被视为公共资源之前是必需的。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:55

# 大语言模型在化妆品化学与皮肤健康中的准确性与可靠性:一项基准测试研究
来源:https://arxiv.org/html/2608.14631
Amelia Liu 独立研究员 美国新泽西州巴斯金里奇,07920 amelialiu2027@gmail\.com
本项目使用的所有Python代码均可在论文的GitHub仓库公开获取:https://github.com/ameliaxl

###### 摘要

随着消费者越来越多地向AI聊天机器人寻求护肤建议,大语言模型(LLM)在化妆品化学领域的技术准确性仍未得到充分评估。我们针对一组结构化的化妆品化学相关主题,对14个LLM进行了基准测试,这些主题涵盖了特定化妆品成分的化学性质,以及消费者可能感兴趣的各种常见化妆品场景。为评估每个模型的内化知识而非其互联网检索能力,整个过程禁用了网络搜索。总体表现欠佳,在定量推理和结构识别任务中缺陷最为明显。虽然模型在处理一般性护肤问题时表现尚可,但其回答始终缺乏为消费者提供知情决策所需的技术深度。值得注意的是,与AI对话可能带来风险:听起来权威但包含技术错误的输出,相比那些明确承认不确定性的回应,更不易引发质疑。这些发现表明,主要基于未经验证的公开数据训练的通用大语言模型,目前并非可靠的化妆品化学信息来源。在实现这些工具成为可公众使用的资源之前,可能需要在两个方面取得进展:一是对经过验证的化学和皮肤病学数据集进行微调,二是算法推理能力的显著提升。

## 1 引言

近年来,大语言模型(LLM)通过展示其在广泛领域内类人认知处理能力,在全球范围内获得了显著的声誉(Naveed et al., 2023)。自ChatGPT问世以来,这些计算工具已融入日常生活,协助数百万用户完成从学术任务、商业自动化到理论物理学和护肤指导等专业咨询(Hostinger, 2025)。

LLM的架构植根于旨在综合海量人类知识的深度学习原理(Naveed et al., 2023)。这些系统利用概率建模来预测语言序列并生成连贯文本。尽管其当代成功通常与2017年Transformer模型和自注意力机制的引入有关,但其渊源可追溯至1950年代的神经网络和1960年代的初级聊天机器人(Vaswani et al., 2017; Toloka AI, 2025)。到2026年初,该领域已发展成高度竞争的格局;OpenAI(2026)声称ChatGPT是市场领导者,每周约有9亿活跃用户。其他具有影响力的架构包括xAI的Grok、Google的Gemini、Meta的Llama、Anthropic的Claude、DeepSeek和Mistral AI。

化妆品化学是化学科学的一个专门分支,关注美观及个人护理产品的配方、开发与评估(Rosen, 2015)。对于消费者而言,化妆品和非处方护肤产品是用于卫生以及管理光老化、痤疮和色素沉着等皮肤问题的实用工具(Goh et al., 2023)。由于专业的皮肤科诊疗通常成本高昂且耗时,许多消费者依赖于质量与科学严谨性参差不齐的在线资源。LLM以其即时可用性、交互格式和权威的语气提供了一个显著的替代选择(Carrara, 2026)。

尽管LLM在消费者场景中的存在感日益增强,但在化妆品化学这一专业领域内,LLM生成回复的科学准确性和可靠性仍然鲜有研究。AI工具能否提供可靠的皮肤健康指导仍是一个持续争论的话题(Ferreira et al., 2023)。虽然这些模型的对话便捷性可能有益于普通消费者,但其在医疗或技术建议方面的应用常因准确性和安全性问题而受到警示(Goktas and Grzybowski, 2024)。

Leon 和 Pimentel(2023)是最早评估ChatGPT在普通化学中应用的学者之一。他们发现,虽然ChatGPT在普通化学中表现出“对话能力”,但在严谨的问题求解上失败了。Guo 等人(2023)在八个关键化学任务上对LLM进行了基准测试。他们发现,即使是最先进的LLM,在从一般性解释转向技术推理时也表现出不稳定的性能。虽然这些论文聚焦于普通化学,但我们对化妆品化学这一专业领域感兴趣。在临床皮肤病学领域,Ferreira 等人(2023)对LLM的初步评估表明,其对患者查询的“适当”回复率很高。然而,其关于成分化学的底层科学严谨性在很大程度上仍未被量化。

本研究评估了来自七家领先AI开发者的14个流行LLM在化妆品化学与皮肤健康的五个主题领域的能力,涵盖定量任务和定性护肤场景。研究结果揭示了基于检索的任务(其中几个模型表现良好)与需要多步化学推理的任务(无论参数数量多少,大多数模型都表现挣扎)之间存在一致的性能差距。这些结果凸显了LLM作为化妆品化学与皮肤病学交叉领域信息工具的潜力与当前局限。

## 2 实验设计与方法

### 2.1 大语言模型

本研究评估了来自七家知名AI开发者的多样化LLM群组,包括Anthropic、DeepSeek、Google、Meta、Mistral AI、OpenAI和xAI,以评估它们解决化妆品化学查询的能力。本次基准测试实验选择了14个模型,每个公司选取两个变体:一个旗舰级“Pro”或“Large”模型,通常以高参数量为特征;以及一个为效率而设计的精简版“Flash”或“Mini”变体。

这些模型的架构能力受其参数量的极大影响,参数量在基于海量异构数据集的预训练过程中确立。虽然参数量常作为原始认知能力的代理指标,但它并非成功的唯一决定因素。训练数据的筛选、架构效率(例如,专家混合模型)以及基于人类反馈的强化学习(RLHF)等因素也对模型的特定性能有显著贡献。Hoffmann 等人(2022)提出的Chinchilla缩放定律表明,在足够大且高质量的数据集上训练时,参数较少的模型可以超越更大的模型。本研究的一个目标是考察在化妆品化学这一专业领域中,模型规模与准确性之间的关系。

具体的模型架构及其相应的参数规模详见表1。注:专有系统(GPT-5、Gemini 2.5 Pro/Flash、Grok 4、Claude 4.5系列)的估算值来源于行业共识基准,而Meta Llama 4系列、Mistral AI和DeepSeek R1的数据则基于公开的技术规格。选择标准优先考虑了市场主导地位和地理多样性。OpenAI的ChatGPT和Google的Gemini代表了消费市场中最普遍的平台。Anthropic、Meta和xAI代表了美国领先的研究机构,而DeepSeek和Mistral AI则分别提供了来自快速发展的中国和欧洲AI领域的关键视角。通过覆盖广泛的训练方法和区域数据集,这种多模型方法确保了对当前化妆品科学AI能力的全面评估。

每个模型都接受了涉及一组预定化妆品化学提示的严格评估,范围从结构键分析到复杂的基团贡献计算。

**表1:被测试的LLM的架构与参数规模比较(2026年第一季度)**

| 开发者      | 旗舰模型          | 参数量         | 效率变体            | 参数量     |
| :---------- | :---------------- | :------------- | :------------------ | :--------- |
| OpenAI      | GPT-5             | ∼1800 B        | GPT-5 Mini          | ∼149 B     |
| Google      | Gemini 2.5 Pro    | ∼288 B         | Gemini 2.5 Flash    | ∼17 B      |
| Meta        | Llama 4 Maverick  | ∼402 B         | Llama 4 Scout       | ∼108 B     |
| xAI         | Grok 4            | ∼1700 B        | Grok 4 Fast         | ∼314 B     |
| Anthropic   | Claude 4.5 Opus   | ∼175 B         | Claude 4.5 Haiku    | ∼20 B      |
| Mistral AI  | Mistral Large 3   | ∼675 B         | Mistral 14B         | 14 B       |
| DeepSeek    | DeepSeek R1       | ∼685 B         | R1-Distill-Qwen-32B | 32 B       |

注:B = 十亿。专有模型的参数量基于行业估计。

### 2.2 实验提示与目标刺激物

为评估LLM综合化妆品领域定量和定性知识的能力,每个模型接受了五个不同主题查询的测试。提示的结构旨在引导出简洁的一句式回应,以确保对事实准确性和技术推理进行聚焦评估。具体提示见附录A。

**定量评估:化学性质与推理**。前四个主题评估了LLM对结构化学和计算逻辑的掌握程度。这些任务是基础性查询,其回应可独立验证:

- •主题1 —— 分子键分析:识别五种化妆品成分的σ键和π键数量:角鲨烷、苯氧乙醇、十二烷基硫酸钠、异十二烷和氯苯甘醚。
- •主题2 —— 成分分析:识别五款知名配方中的合成防腐剂,包括CeraVe保湿爽肤水、Kiehl's高效保湿霜和The Ordinary透明质酸2% + B5(2024年重配版)。
- •主题3 —— 分子量测定:查找角鲨烷、辛烷、十二烷、异丙醇和氯苯甘醚的分子量(四舍五入至一位小数)。
- •主题4 —— 热物理估算(Joback法):使用Joback法计算正常沸点(单位:开尔文)(Joback and Reid, 1987)。此任务测试了超越简单数据检索的多步算法推理能力。

**定性护肤建议评估**:主题5要求LLM在两个现实情境中提供面向消费者的指导:(1)序列护肤建议,描述在特定干预(例如,壬二酸、洁面)后,针对敏感、易长痘皮肤的后续步骤;以及(2)第一步建议,确定针对色素沉着过度和皮脂分泌过多等问题的初始治疗方法。

**方法严谨性与验证**:所有实验场景均在数据收集前构思,以防止任何形式的事后选择。测试刺激物,包括特定的化妆品成分和成品,是根据其在个人护理中的使用频率和重要性筛选的。实验场景进一步设计以模拟高频、真实的消费者互动。定量回应与NCBI PubChem交叉验证(Kim et al., 2023)。定性输出则以《Harry's Cosmeticology》(Rosen, 2015)等基础教科书为基准。

### 2.3 实验设计

与所选LLM的所有交互均系统化进行,以确保模型间的一致性和可重复性。为通过单一标准化端点与多个LLM交互,我们使用了OpenRouter API网关,这是一个提供访问不同提供商数百个大语言模型的统一网关(OpenRouter, 2025)。查询使用OpenAI官方Python库自动化(OpenAI, 2025),使每个预定查询能在相同条件下提交给所有14个模型,响应通过编程方式收集以供后续分析。

**提示标准化与偏差缓解**:为保持受控的实验环境,每个查询作为离散、独立的请求提交。为缓解对话漂移或“思维链”偏差的影响,系统配置为在查询间不保留上下文。每个模型仅基于即时提示制定其回应,不受可能人为提升性能的延续效应或外部指导影响。所有提示均以“零样本”格式提供,不包含补充指令或系统级提示。

**控制幻觉与推理完整性**:AI幻觉,即模型生成流畅连贯但事实不准确或完全虚构回应的倾向,仍然是LLM领域一个有据可查的挑战(Huang et al., 2024)。研究表明,模糊或模棱两可的输入常常通过迫使LLM概率性地依赖其训练数据而非事实综合而加剧幻觉。因此,使用清晰、一致和明确的问题,并消除网络聊天机器人交互中常见的迭代对话,是针对此风险有意采取的方法论保障。

**内在知识与网络检索的评估**:在模型的基于参数的内在知识与其执行实时信息检索的能力之间做出了关键区分。因此,所有API交互均配置为禁用网络访问功能。这一设计选择确保了回应完全源自模型在各自知识截止日期前冻结的预训练语料库。此限制旨在作为控制,防止检索增强生成(RAG)掩盖底层模型架构的真实推理能力(Lewis et al., 2020)。

### 2.4 数据分析

LLM输出通过Python编程提取,并整理成一个汇总表,列出每个化妆品化学查询和每个模型的准确率百分比。每个查询的准确率计算为正确回应数量除以查询的成分或产品总数。为考察LLM的参数是否预测准确率,使用SciPy库进行了简单线性回归,统计显著性定义为$p < 0.05$。对于定性问题,使用WordCloud Python库对回应内容进行了词云分析。这是一种成熟的可视化技术,其中词语大小反映其出现频率,提供了最常...

相似文章

大型语言模型用于安全数据提取的基准测试

arXiv cs.CL

本文对四种大型语言模型(Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70B)从安全数据表中提取结构化信息的能力进行了基准测试,发现基于文本的提取结合思维链提示可获得最高准确率(Gemini 1.5 Pro 为84%),但没有任何模型超过工业可靠部署所需的90%阈值。

大型语言模型响应的全面评估:多因素评分系统

arXiv cs.CL

本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。