@PierceZhang34: 10秒训练一个小模型! LLM 训练神器:http://llm.istanbul 初体验 最近发现了一个超级有趣的开源风格工具网站 —— http://llm.istanbul,它号称 WebGPU LLM Workbench,意思是完全…

X AI KOLs Timeline 工具

摘要

介绍了一个名为 llm.istanbul 的 WebGPU LLM 工作台,可在浏览器中训练小模型、训练分词器并生成文本。无需服务器,完全本地运行。

10秒训练一个小模型! LLM 训练神器:http://llm.istanbul 初体验 最近发现了一个超级有趣的开源风格工具网站 —— http://llm.istanbul,它号称 WebGPU LLM Workbench,意思是完全在浏览器里用 GPU 训练和玩转小型语言模型 不需要服务器、不需要云端、不用上传数据,一切都在你自己的电脑浏览器里完成 这对想动手实践 LLM 原理、训练 tokenizer、从零预训练小模型的朋友来说,简直是梦幻玩具 三大核心功能 1. 训练 Tokenizer(分词器) 上传任意文本文件(支持文件夹批量),选择词汇表大小(512 到 64K),就能在 GPU 上实时观看 BPE 合并过程 训练完可以导出 .json 词汇表,或直接生成 .bin 预分词数据供下一步使用 非常适合给特定语言或领域定制 tokenizer 2. 训练 Transformer 模型 支持从零预训练 或 加载 .llm 检查点继续训练/微调 你可以自由调整: 模型规模(d_model、n_layers、n_heads 等) 优化器、学习率、warmup、weight decay 等超参 序列长度、激活函数(GeLU / SwiGLU)等 前向、反向传播和 AdamW 优化全部在本地 GPU 上跑,实时看到 loss 下降 3. 文本生成测试 加载训练好的 .llm 文件,输入 prompt 就能实时生成。 支持 temperature、top-k、top-p 等采样参数调节,方便快速验证模型效果 核心亮点 完全本地隐私:数据和模型永远在你设备上 WebGPU 加速:需要 Chrome/Edge 等支持 WebGPU 的浏览器 + 较强 GPU(集成显卡也能跑小模型) 轻量实验向:适合学习、原型验证、小规模玩耍,不适合训百亿参数大模型 文件格式:自定义 .llm(含词汇表 + 权重)和 .bin 预分词文件,便于保存和复用 适用人群LLM 入门爱好者,想亲手从零实现 tokenizer + transformer 研究 tokenizer 对模型影响的学生/开发者 想在本地快速迭代小型领域模型的人 对 WebGPU、浏览器 AI 感兴趣的技术玩家 传送门:https://llm.istanbul
查看原文
查看缓存全文

缓存时间: 2026/06/12 06:55

10秒训练一个小模型!

LLM 训练神器:http://llm.istanbul 初体验

最近发现了一个超级有趣的开源风格工具网站 —— http://llm.istanbul,它号称 WebGPU LLM Workbench,意思是完全在浏览器里用 GPU 训练和玩转小型语言模型

不需要服务器、不需要云端、不用上传数据,一切都在你自己的电脑浏览器里完成

这对想动手实践 LLM 原理、训练 tokenizer、从零预训练小模型的朋友来说,简直是梦幻玩具

三大核心功能

  1. 训练 Tokenizer(分词器) 上传任意文本文件(支持文件夹批量),选择词汇表大小(512 到 64K),就能在 GPU 上实时观看 BPE 合并过程 训练完可以导出 .json 词汇表,或直接生成 .bin 预分词数据供下一步使用 非常适合给特定语言或领域定制 tokenizer

  2. 训练 Transformer 模型 支持从零预训练 或 加载 .llm 检查点继续训练/微调 你可以自由调整: 模型规模(d_model、n_layers、n_heads 等)
    优化器、学习率、warmup、weight decay 等超参
    序列长度、激活函数(GeLU / SwiGLU)等 前向、反向传播和 AdamW 优化全部在本地 GPU 上跑,实时看到 loss 下降

  3. 文本生成测试 加载训练好的 .llm 文件,输入 prompt 就能实时生成。 支持 temperature、top-k、top-p 等采样参数调节,方便快速验证模型效果

核心亮点 完全本地隐私:数据和模型永远在你设备上 WebGPU 加速:需要 Chrome/Edge 等支持 WebGPU 的浏览器 + 较强 GPU(集成显卡也能跑小模型) 轻量实验向:适合学习、原型验证、小规模玩耍,不适合训百亿参数大模型 文件格式:自定义 .llm(含词汇表 + 权重)和 .bin 预分词文件,便于保存和复用

适用人群LLM 入门爱好者,想亲手从零实现 tokenizer + transformer 研究 tokenizer 对模型影响的学生/开发者 想在本地快速迭代小型领域模型的人 对 WebGPU、浏览器 AI 感兴趣的技术玩家

传送门:https://llm.istanbul


llm.istanbul — WebGPU LLM workbench

Source: https://llm.istanbul/

1 · Train a tokenizer

Build a Byte Pair Encoding vocabulary for your language. Drop text files, pick a vocab size, watch merges happen on your GPU. Save the\.json— Pre-tokenize feeds it to the transformer in step 3.

Training DataDrop files here orbrowse

Multiple files OK ·browse folderfor recursive scan

Shuffle paragraphs

Vocabulary Size InspectNo vocabulary loaded — train one above or load a .json

BPE Trainer ProfilerNo snapshots yet. Click “One-shot” or “Start Profiler” while training to capture per-kernel GPU timing.

Output Log

3 · Train a transformer

Two flows in one: pretrain a fresh foundation model on your\.bin, or load a\.llmcheckpoint and fine-tune it on a smaller, task-specific corpus. Forward, backward, and AdamW all run on your GPU — no server, no cloud.

EngineLLM engine not initialized

Dataset (.bin)Drop a.binfile orbrowse

Produced by the Pre-tokenize tab

Model Size Training Checkpoint

GPU ProfilerNo snapshots yet. Click “Snapshot Next Step” while training to capture per-kernel GPU timing.

Output Log

Generate from a model

Drop a\.llmcheckpoint, type a prompt, watch tokens stream. No\.binneeded — vocab + weights ride with the checkpoint. Useful for sanity-checking a run, comparing two checkpoints, or just playing with sampling knobs.

ModelNo model loaded — drop a .llm to begin

Generatetemptop-ktop-pmin-preptokens

相似文章

@NFTCPS: 4GB显存跑70B大模型?这事儿真成了! AirLLM玩了个骚操作——分层推理,不一次性把模型怼进显存,而是一层层加载、算完就扔,硬生生把巨无霸塞进小破卡。 最骚的是:100%开源,白嫖警告 https://github.com/0xSo…

X AI KOLs Timeline

AirLLM 是一个完全开源的工具,通过分层推理技术(逐层加载并立即释放显存),使得 70B 大语言模型可在仅 4GB 显存的 GPU 上运行,无需量化、蒸馏或剪枝,并已支持 Llama3.1 405B 在 8GB 显存上运行。

@zhixianio: 这两天新机器到了之后,我开始了「苦行僧」式的强迫自己使用本地模型来完成常见任务的修行 本以为会非常痛苦,没想到无论是速度还是质量都大大超出我的预期: 模型: Qwen3.6-35B-A3B-oQ6-fp16-mtp 运行:oMLX,开 N…

X AI KOLs Timeline

作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。

WebLLM: 高性能浏览器内LLM推理引擎

Hacker News Top

WebLLM是一个高性能的浏览器内LLM推理引擎,它利用WebGPU进行硬件加速,并且完全兼容OpenAI API,使得开源语言模型可以在本地运行。