训练数据在训练前需要一个真正的通过/不通过门控[D]
摘要
作者提出一个正式的训练前控制层,用于审计训练数据工件,并基于明确标准给出判定(通过/不通过),作为数据准备与训练之间缺失的门控,并邀请讨论其实用性。
我们有针对代码、基础设施、部署和模型性能的门控。但到了实际的训练工件时,是否继续推进的决定往往仍然分散在笔记本、验证脚本、仪表板和人工判断中。这看起来是一个薄弱环节。我一直在思考一个适当的训练前控制层应该是什么样子。不是另一个只会生成一长串警告的工具,而是一个本地系统,能够审计即将使用的确切工件,并给出可重现的“通过”、“警告”、“不通过”或“不通过_安全”判定。该判定应基于明确的证据和硬性门控:泄漏、矛盾、冗余、覆盖率、来源、证据完整性,以及工件与其声明的训练目标之间的差距。关键区别在于,LLM不会决定判定结果。相同的工件、目标和配置应产生相同的结果。关键失败不应隐藏在体面的总体评分中。该系统还可以生成修复计划,仅对派生副本应用批准的更改,保留原始版本,然后运行第二次审计。所有内容都与清单、校验和及确切执行绑定。在我看来,这像是数据准备与训练之间缺失的一层。但我也能预见到最大的反对意见:训练数据的质量具有上下文相关性,如果系统不够透明,正式的判定可能会造成虚假的信心。因此,我很好奇,实际使用训练管线的人会如何对待这样的系统。你会让它阻止一次训练运行吗?你会相信判定结果,还是只相信背后的证据?在你的团队认真对待它之前,它需要证明什么?
相似文章
CLAP:领域智能体后训练的闭环训练、评估与发布控制
CLAP提出了一种面向领域智能体后训练的闭环方法,将含噪业务数据转化为结构化的SFT和偏好样本,并结合奖励/KL诊断、离线门控以及应用链路重放来决定适配器是否发布。在五个制造批次上的实验显示平均增益适度,并强调回归和高KL风险需要集成的数据-训练-评估-发布循环,而非依赖单一评分。
在允许智能体自主行动之前,你将其视为第一个真正的安全闸门是什么?
讨论了一种针对AI智能体的三阶段安全部署(观察、提议、在限定范围内执行),以将推理与执行信任分离,并向社区询问关于减少失败的第一道硬性闸门。
互动训练 2:面向实时模型训练的可审计控制平面
互动训练 2 引入了一个通过共享协议引导实时模型训练的可审计控制平面,允许人类和自动化控制器提交请求,这些请求在安全控制点进行验证并应用。该系统在自然语言处理(NLP)和强化学习工作流中进行了演示。
模块化预训练实现访问控制
本文介绍了GRAM(梯度路由辅助模块),一种模块化预训练方法,通过选择性添加和消融模块来限制AI模型的双重用途能力,实现访问控制,并显示出相较于数据过滤的成本降低。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。