knowledge-control

标签

Cards List
#knowledge-control

@AnthropicAI: We’re pleased to have collaborated with AE Studio on this research. Read more here: https://anthropic.com/research/off-…

X AI KOLs · 2026-07-08 缓存

Anthropic and AE Studio propose GRAM (Gradient-Routed Auxiliary Modules), a method to surgically confine dual-use knowledge in AI models to removable modules, enabling selective access without retraining multiple models. Preliminary results show promise for more flexible safety controls.

0 人收藏 0 人点赞
#knowledge-control

2026年7月8日 对齐 一种针对AI模型中双重用途知识的关闭开关

Anthropic Research · 2026-07-09 缓存

Anthropic和AE Studio推出了GRAM方法,该方法将AI模型中的双重用途知识限制在可移除模块中,从而无需重新训练整个模型即可对危险能力进行精准控制。初步结果表明,这有望实现前沿模型的更安全部署。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈