标签
本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。
T2D-Bench是一个基于多层临床-生活方式知识图谱的基准测试,用于评估大语言模型在2型糖尿病方面的输出。结果显示,当前大语言模型约有三分之一的情况未能通过证据路径检查。