标签
本研究对14个大型语言模型在化妆品化学与皮肤健康主题上进行了基准测试,发现其准确性和可靠性较差,尤其在技术性和量化任务中。研究得出结论,当前通用型LLM在未经过进一步微调和算法改进的情况下,无法为知情的消费者决策提供可靠信息。