gpt-2

标签

Cards List
#gpt-2

表征简单性与回路规模以阈值依赖的方式解耦:通过对抗训练进行的对照检验

arXiv cs.AI ↗ · 2天前 缓存

该预印本以对抗训练作为对照工具,在 GPT-2 Small 上检验表征简单性(SAE 可分解性、集中化归因)是否蕴含回路在因果上的简单性。研究发现,鲁棒模型具有更强的 SAE 可分解性,而回路规模则取决于机制区间:在高忠实度水平(90-95%)下,鲁棒性有所帮助,但在 85% 以下则无此效果。

0 人收藏 0 人点赞
#gpt-2

建模有界性习得的发展性转变

arXiv cs.CL ↗ · 2026-09-17 缓存

本文介绍了一种使用GPT-2标记预测意外度来标注儿童语言中有界性的方法,发现儿童模型依赖于句法线索(如动词后限定词),而成人模型更多使用语义特征,支持了句法引导理论。

0 人收藏 0 人点赞
#gpt-2

快跑!GPT-2 会杀了我们所有人!!

Reddit r/singularity ↗ · 2026-09-14

该文章幽默或惊悚地探讨了OpenAI GPT-2 AI模型的潜在风险及其被夸大的能力。

0 人收藏 0 人点赞
#gpt-2

GPT-2 在纯 CMake 中的实现

Hacker News Top ↗ · 2026-08-23 缓存

这个 GitHub 仓库提供了用于执行 GPT-2 的 CMake 脚本,使用 Q16.16 整数算术,包括运行完整模型和玩具模型的说明。

0 人收藏 0 人点赞
#gpt-2

我刚刚从零开始构建了一个迷你版Kimi-K3,花费不到250美元!已经击败了GPT-2(124M)!

Reddit r/LocalLLaMA ↗ · 2026-08-20

一位研究人员以不到250美元构建了一个拥有10.2亿参数的迷你版Kimi-K3模型,其HellaSwag得分达到33.4%,超过了GPT-2的28%得分。

0 人收藏 0 人点赞
#gpt-2

逆向工程RK3588 NPU:构建开放编译器以36 tok/s运行GPT-2

Reddit r/LocalLLaMA ↗ · 2026-08-19

逆向工程了RK3588 NPU并构建了一个开放编译器和运行时,以从PyTorch、ONNX和JAX运行GPT-2和SigLIP,无需供应商SDK。

0 人收藏 0 人点赞
#gpt-2

评估针对达罗毗荼语的专用单语模型与联合多语言因果模型

arXiv cs.CL ↗ · 2026-08-11 缓存

本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。

0 人收藏 0 人点赞
#gpt-2

@xiaoying_eth: 前OpenAI的Andrej Karpathy搞了个疯狂的项目 用1000块美金训练出来的ChatGPT,代码少到不行,核心逻辑全看得懂 从预训练、微调到强化学习,整个LLM开发流程浓缩在几个Python文件里 最绝的是,你真的能花几万块…

X AI KOLs Timeline ↗ · 2026-08-03 缓存

Andrej Karpathy 发布了 nanochat,一个极简的 LLM 训练框架,只需约 48 美元就能训练出 GPT-2 级别的模型,涵盖预训练、微调和强化学习全流程,代码量极少且完全透明。

0 人收藏 0 人点赞
#gpt-2

后续:GPT-2的词汇表作为双曲树 — 在一个可以飞越的庞加莱球中的32,070个词元 [P]

Reddit r/MachineLearning ↗ · 2026-07-19

一个后续项目,将GPT-2的32,070个词元可视化为一棵位于庞加莱球中的交互式双曲树,允许用户在嵌入空间中飞越。

0 人收藏 0 人点赞
#gpt-2

GPT-2 的令牌嵌入空间交互式地图 - 点击任意令牌进行探索 [P]

Reddit r/artificial ↗ · 2026-07-19 缓存

GPT-2 令牌嵌入空间的交互式地图,用户可点击任意令牌探索其嵌入。

0 人收藏 0 人点赞
#gpt-2

GPT-2 Small 围绕“特朗普”的嵌入几何:离散化与连续最近邻 [P]

Reddit r/MachineLearning ↗ · 2026-07-18

本文研究了GPT-2 Small在词元“特朗普”周围的嵌入几何,比较了离散化与连续最近邻方法,以理解表征结构。

0 人收藏 0 人点赞
#gpt-2

语言再生:信息局部性对重建影响的探究

arXiv cs.CL ↗ · 2026-07-14 缓存

本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。

0 人收藏 0 人点赞
#gpt-2

GPT-2 内部完全解码:黑盒全开,附带演示

Reddit r/artificial ↗ · 2026-07-11

BABEL 编解码器实现了对 GPT-2 small 内部状态的首次完整解码,重构了其 94.7% 的行为,并支持用英语读写模型,同时提供开源资源和演示。

0 人收藏 0 人点赞
#gpt-2

表征作为机制可解释性的瓶颈:Manifestation Unit协议

arXiv cs.LG ↗ · 2026-07-02 缓存

本文介绍了Manifestation Units,这是一种类型化元组协议,用于将机制可解释性分析中的每个组件的统计量组织成结构化、可查询的字段。该协议在视觉(β-VAE、CNN)和语言(GPT-2)模型上进行了演示,展示了改进的检索和因果充分性。

0 人收藏 0 人点赞
#gpt-2

多重中介者的诅咒:激活修补中的隐藏交互效应

arXiv cs.LG ↗ · 2026-06-29 缓存

本文从因果中介分析重新推导激活修补,揭示自然间接效应(NIE)不仅捕捉组件的因果效应,还捕捉与其他组件的交互效应。文章在GPT-2 IOI电路中展示了这些隐藏交互,并论证它们是一种诊断工具而非干扰。

0 人收藏 0 人点赞
#gpt-2

Show HN: NanoEuler – 从头开始用纯C/CUDA实现的GPT-2规模模型

Hacker News Top ↗ · 2026-06-28 缓存

NanoEuler 是一个完全用纯 C/CUDA 从头构建的 GPT-2 规模语言模型,不依赖任何机器学习库,包括手写的前向/反向传播、字节级 BPE 分词器和训练流水线。该项目是一个教育示范,展示了 Transformer 训练背后的工程原理,可在单个 RTX 4070 上运行。

0 人收藏 0 人点赞
#gpt-2

GPT-2 过于危险,不宜发布

Reddit r/singularity ↗ · 2026-06-27

OpenAI 开发了 GPT-2 语言模型,但认为其可能被滥用,过于危险,因此未向公众发布。

0 人收藏 0 人点赞
#gpt-2

当前世界模型缺乏持久状态核心

Hugging Face Daily Papers ↗ · 2026-06-18 缓存

本文认为当前世界模型缺乏持久状态核心,提出一种混合方法,通过η-伪酉算子动力学添加时间因果结构,将预训练的GPT-2转化为时间推理模型。

0 人收藏 0 人点赞
#gpt-2

无中生有:语言模型能否发现零?

arXiv cs.AI ↗ · 2026-06-17 缓存

本文探讨了语言模型能否独立发现零的概念,作为分布外泛化的一种形式。研究发现,GPT-2大小的模型在测试时无法做到,但通过零的示例训练后会有显著提升,并且语言预训练减少了所需示例的数量。

0 人收藏 0 人点赞
#gpt-2

显微镜下的数据流形

Hugging Face Daily Papers ↗ · 2026-06-14 缓存

本文研究了使用η-伪幺正算子动力学将预训练的GPT-2转换为时间推理模型,提供了数学基础以及在PT对称性破缺转变和可逆/不可逆序列方面的关键发现。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈