开源表格模型验证工具包TanML寻求反馈 [D]
摘要
TanML是一个采用MIT许可的自动化模型验证工具包,专为表格机器学习模型设计,适用于受监管环境。开发者希望就其功能和报告获得反馈。
我们正在开发TanML,一个采用MIT许可的自动化模型验证工具包,用于表格机器学习模型。TanML在本地运行,提供端到端的工作流程,涵盖数据剖析、预处理、特征重要性排序、模型开发、评估、漂移分析、压力测试、SHAP可解释性以及可直接用于审计的Word报告。它专为银行、信用风险、保险以及其他受监管环境中的模型风险工作流而设计。我们非常希望得到模型开发者和验证者的批评反馈:哪些功能在您现有的工作流程中会很有用?缺少哪些重要的验证测试?生成的报告是否适合独立审查?是什么阻止您的团队采用这样的工具包?GitHub: https://github.com/tdlabs-ai/tanml
相似文章
TabularMath:用大语言模型理解表格上的数学推理
TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。
Xiaomi-TabLDM: 表格基础模型技术报告
介绍了Xiaomi-TabLDM,一个表格基础模型,它利用合成数据和上下文学习实现卓越的预测精度,无需特定任务微调,并在多个基准测试中获得顶级排名。
评估表格数据基础模型的比较框架:医疗保健案例研究
本文介绍OpTFM,一个针对医疗保健领域表格基础模型的比较评估框架,从六个临床意义显著的维度(如泛化性和公平性)评估模型,并应用于两个用例以展示上下文依赖的排名。
TriVAL: 一个用于忠实自动优化建模的三重验证框架
TriVAL 引入了一个三重验证框架,在自动优化建模的三个阶段(语义规范、数学公式、代码生成)执行显式验证以提高忠实性,并提出了 NL4COP,一个用于组合优化问题的新基准。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。