GPT-2 内部完全解码:黑盒全开,附带演示

Reddit r/artificial 论文

摘要

BABEL 编解码器实现了对 GPT-2 small 内部状态的首次完整解码,重构了其 94.7% 的行为,并支持用英语读写模型,同时提供开源资源和演示。

BABEL 编解码器:首次对生产级语言模型(GPT-2 small)内部发生的一切进行完整且经认证的解码。它将模型的内部状态读取为英语,并将英语写回模型。重构了 94.7% 的行为——并且这在测试的每一层深度和文本范围内都成立,而不仅仅是在某一点。一切都是开放的:论文、完整词库、语法表、解码器/编码器权重、复现脚本,以及一个能展示模型对任意输入句子的思考过程的演示。https://github.com/wpferrell/babel-codec-gpt2
查看原文

相似文章

GPT-5.3-Codex 系统卡

OpenAI Blog

OpenAI 发布了 GPT-5.3-Codex,这是目前最强大的代理型编码模型,结合了前沿的编码性能与高级推理能力,具备交互式长时间任务执行功能,并在网络安全领域引入了新颖的高能力安全防护措施。

GPT-5.2-Codex 介绍

OpenAI Blog

OpenAI 发布了 GPT-5.2-Codex,这是一个先进的代理型编码模型,针对复杂软件工程任务进行了优化,在长上下文理解、Windows 支持和网络安全能力方面有所改进。该模型在 SWE-Bench Pro 和 Terminal-Bench 2.0 上取得了最先进的性能,现已向付费 ChatGPT 用户开放,API 访问将在未来几周内提供。

GPT-2: 1.5B 版本发布

OpenAI Blog

OpenAI 发布了 GPT-2 1.5B 参数模型,附带了人类对可信度感知的分析、通过在极端意识形态微调进行滥用的潜在风险,以及检测合成文本的挑战。检测模型达到约 95% 的准确率,但在实际部署中需要配套方法。

更好的语言模型及其影响

OpenAI Blog

OpenAI 推出 GPT-2,这是一个拥有 15 亿参数的基于 Transformer 的语言模型,在 40GB 的互联网文本上进行训练,在语言建模基准上达到了最先进的性能,并在阅读理解、翻译、问答和摘要生成等任务上展示了零样本学习能力。出于安全考虑,仅公开发布了较小的模型和技术论文,而非完整的训练模型。