以数据为中心的调试:面向训练神经网络的团队 [P]
摘要
WeightsLab 是一个开源、PyTorch 原生的工具,允许团队在训练过程中暂停、检查实时损失信号,并在数据问题(如标签错误和类别不平衡)影响模型性能之前发现它们。它专为处理图像、视频和 LiDAR 点云的计算机视觉工程师而设计。
我们刚刚对 WeightsLab 进行了重大改进,并想在此分享。如果你曾经花数小时调试训练过程,最终却发现一直是数据问题,那么这个工具就是为你准备的。WeightsLab 允许你在运行中暂停训练,检查实时损失信号,并在标签错误、类别不平衡和异常值破坏你的模型之前捕获它们。开源、PyTorch 原生,专为处理图像、视频和 LiDAR 点云数据的计算机视觉工程师打造。非常希望听到社区的看法,以及它是否看起来有用,并帮助更多人找到它:[ https://github.com/GrayboxTech/weightslab]
相似文章
我为 PyTorch 训练循环构建调试器所学到的东西,以及它如何改变我对故障诊断的思考 [D]
作者分享了构建 NeuralDBG 的经验,这是一个针对 PyTorch 训练循环的开源调试器,通过监测逐层梯度范数的变化而非全局损失来检测局部故障,如梯度消失/爆炸。文中包含实用代码片段和社区问题。
[P] 一个从零开始用 NumPy 构建的小型 MLP,带有一个 GUI 可以在训练时查看其内部(权重分布、每层的 t-SNE、神经元消融...)[P]
一个使用 NumPy 构建的教育工具,带有 GUI 可以可视化小型 MLP 的训练过程,包括权重分布、每层的 t-SNE 和神经元消融,旨在帮助学生和教师理解神经网络。
WARP: 权重空间分析用于恢复训练数据组合
WARP是一种框架,通过模型合并生成伪检查点并提取几何特征,从已发布权重中恢复微调模型的域混合权重。它在BERT和GPT-2上实现了低平均绝对误差,优于成员推断。
你存在于权重中吗?
一个工具,让你检查你的数据是否被包含在大语言模型的训练集中,探索AI中的数字永生概念。
窃取你的权重
这篇文章可能讨论了与窃取AI模型权重相关的方法或漏洞,强调了机器学习系统中的安全担忧。