gpt-2

标签

Cards List
#gpt-2

评估针对达罗毗荼语的专用单语模型与联合多语言因果模型

arXiv cs.CL · 4天前 缓存

本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。

0 人收藏 0 人点赞
#gpt-2

@xiaoying_eth: 前OpenAI的Andrej Karpathy搞了个疯狂的项目 用1000块美金训练出来的ChatGPT,代码少到不行,核心逻辑全看得懂 从预训练、微调到强化学习,整个LLM开发流程浓缩在几个Python文件里 最绝的是,你真的能花几万块…

X AI KOLs Timeline · 2026-08-03 缓存

Andrej Karpathy 发布了 nanochat,一个极简的 LLM 训练框架,只需约 48 美元就能训练出 GPT-2 级别的模型,涵盖预训练、微调和强化学习全流程,代码量极少且完全透明。

0 人收藏 0 人点赞
#gpt-2

后续:GPT-2的词汇表作为双曲树 — 在一个可以飞越的庞加莱球中的32,070个词元 [P]

Reddit r/MachineLearning · 2026-07-19

一个后续项目,将GPT-2的32,070个词元可视化为一棵位于庞加莱球中的交互式双曲树,允许用户在嵌入空间中飞越。

0 人收藏 0 人点赞
#gpt-2

GPT-2 的令牌嵌入空间交互式地图 - 点击任意令牌进行探索 [P]

Reddit r/artificial · 2026-07-19 缓存

GPT-2 令牌嵌入空间的交互式地图,用户可点击任意令牌探索其嵌入。

0 人收藏 0 人点赞
#gpt-2

GPT-2 Small 围绕“特朗普”的嵌入几何:离散化与连续最近邻 [P]

Reddit r/MachineLearning · 2026-07-18

本文研究了GPT-2 Small在词元“特朗普”周围的嵌入几何,比较了离散化与连续最近邻方法,以理解表征结构。

0 人收藏 0 人点赞
#gpt-2

语言再生:信息局部性对重建影响的探究

arXiv cs.CL · 2026-07-14 缓存

本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。

0 人收藏 0 人点赞
#gpt-2

GPT-2 内部完全解码:黑盒全开,附带演示

Reddit r/artificial · 2026-07-11

BABEL 编解码器实现了对 GPT-2 small 内部状态的首次完整解码,重构了其 94.7% 的行为,并支持用英语读写模型,同时提供开源资源和演示。

0 人收藏 0 人点赞
#gpt-2

表征作为机制可解释性的瓶颈:Manifestation Unit协议

arXiv cs.LG · 2026-07-02 缓存

本文介绍了Manifestation Units,这是一种类型化元组协议,用于将机制可解释性分析中的每个组件的统计量组织成结构化、可查询的字段。该协议在视觉(β-VAE、CNN)和语言(GPT-2)模型上进行了演示,展示了改进的检索和因果充分性。

0 人收藏 0 人点赞
#gpt-2

多重中介者的诅咒:激活修补中的隐藏交互效应

arXiv cs.LG · 2026-06-29 缓存

本文从因果中介分析重新推导激活修补,揭示自然间接效应(NIE)不仅捕捉组件的因果效应,还捕捉与其他组件的交互效应。文章在GPT-2 IOI电路中展示了这些隐藏交互,并论证它们是一种诊断工具而非干扰。

0 人收藏 0 人点赞
#gpt-2

Show HN: NanoEuler – 从头开始用纯C/CUDA实现的GPT-2规模模型

Hacker News Top · 2026-06-28 缓存

NanoEuler 是一个完全用纯 C/CUDA 从头构建的 GPT-2 规模语言模型,不依赖任何机器学习库,包括手写的前向/反向传播、字节级 BPE 分词器和训练流水线。该项目是一个教育示范,展示了 Transformer 训练背后的工程原理,可在单个 RTX 4070 上运行。

0 人收藏 0 人点赞
#gpt-2

GPT-2 过于危险,不宜发布

Reddit r/singularity · 2026-06-27

OpenAI 开发了 GPT-2 语言模型,但认为其可能被滥用,过于危险,因此未向公众发布。

0 人收藏 0 人点赞
#gpt-2

当前世界模型缺乏持久状态核心

Hugging Face Daily Papers · 2026-06-18 缓存

本文认为当前世界模型缺乏持久状态核心,提出一种混合方法,通过η-伪酉算子动力学添加时间因果结构,将预训练的GPT-2转化为时间推理模型。

0 人收藏 0 人点赞
#gpt-2

无中生有:语言模型能否发现零?

arXiv cs.AI · 2026-06-17 缓存

本文探讨了语言模型能否独立发现零的概念,作为分布外泛化的一种形式。研究发现,GPT-2大小的模型在测试时无法做到,但通过零的示例训练后会有显著提升,并且语言预训练减少了所需示例的数量。

0 人收藏 0 人点赞
#gpt-2

显微镜下的数据流形

Hugging Face Daily Papers · 2026-06-14 缓存

本文研究了使用η-伪幺正算子动力学将预训练的GPT-2转换为时间推理模型,提供了数学基础以及在PT对称性破缺转变和可逆/不可逆序列方面的关键发现。

0 人收藏 0 人点赞
#gpt-2

GPT-2以来AI模型发展时间线:模型发布速度不断加快

Reddit r/ArtificialInteligence · 2026-06-01

一篇记录自GPT-2以来AI模型发布时间线的文章,强调了模型发布速度不断加快的趋势。

0 人收藏 0 人点赞
#gpt-2

MechRL:强化学习代理用于机制可解释性中的电路发现

arXiv cs.LG · 2026-05-27 缓存

提出了 MechRL,一种利用强化学习自动发现 transformer 语言模型中电路的方案。经过多任务训练的 PPO 代理发现了与已知典型电路匹配的注意力头电路,并能泛化到一项保留任务上。

0 人收藏 0 人点赞
#gpt-2

我构建了一个工具,能实时展示GPT-2在生成文本时的“思维”过程:每个令牌的概念激活3D图 [R]

Reddit r/MachineLearning · 2026-05-19

一位开发者构建了AXON,该工具利用稀疏自编码器将GPT-2的内部概念激活可视化为实时3D力导向图,使用户能够在令牌生成前看到可解释特征的激活情况。

0 人收藏 0 人点赞
#gpt-2

@Modular: MAX-LLM 书籍让从零开始构建 LLM 变得更加简单。新的笔记本格式让你可以运行 GPT-2 …

X AI KOLs Following · 2026-05-14 缓存

MAX-LLM 书籍现在提供交互式 Jupyter 笔记本,逐步指导用户使用 MAX 框架从零开始构建完整的 GPT-2 实现,使用户能够探索张量形状、运行组件并生成文本。

0 人收藏 0 人点赞
#gpt-2

我们能否定位并防止LLM中的刻板印象?

arXiv cs.CL · 2026-04-23 缓存

arXiv预印本在GPT-2 Small与Llama 3.2中定位编码刻板印象的神经元与注意力头,显示偏见集中在少数神经元子集,但消融它们几乎无法减少带偏文本生成。

0 人收藏 0 人点赞
#gpt-2

GPT Image 2 的游戏梗图潜力炸裂

Reddit r/singularity · 2026-04-21

用户发现 GPT Image 2 在生成游戏专属梗图方面表现惊人。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈