@PierceZhang34: 10秒训练一个小模型! LLM 训练神器:http://llm.istanbul 初体验 最近发现了一个超级有趣的开源风格工具网站 —— http://llm.istanbul,它号称 WebGPU LLM Workbench,意思是完全…
摘要
介绍了一个名为 llm.istanbul 的 WebGPU LLM 工作台,可在浏览器中训练小模型、训练分词器并生成文本。无需服务器,完全本地运行。
查看缓存全文
缓存时间: 2026/06/12 06:55
10秒训练一个小模型!
LLM 训练神器:http://llm.istanbul 初体验
最近发现了一个超级有趣的开源风格工具网站 —— http://llm.istanbul,它号称 WebGPU LLM Workbench,意思是完全在浏览器里用 GPU 训练和玩转小型语言模型
不需要服务器、不需要云端、不用上传数据,一切都在你自己的电脑浏览器里完成
这对想动手实践 LLM 原理、训练 tokenizer、从零预训练小模型的朋友来说,简直是梦幻玩具
三大核心功能
-
训练 Tokenizer(分词器) 上传任意文本文件(支持文件夹批量),选择词汇表大小(512 到 64K),就能在 GPU 上实时观看 BPE 合并过程 训练完可以导出 .json 词汇表,或直接生成 .bin 预分词数据供下一步使用 非常适合给特定语言或领域定制 tokenizer
-
训练 Transformer 模型 支持从零预训练 或 加载 .llm 检查点继续训练/微调 你可以自由调整: 模型规模(d_model、n_layers、n_heads 等)
优化器、学习率、warmup、weight decay 等超参
序列长度、激活函数(GeLU / SwiGLU)等 前向、反向传播和 AdamW 优化全部在本地 GPU 上跑,实时看到 loss 下降 -
文本生成测试 加载训练好的 .llm 文件,输入 prompt 就能实时生成。 支持 temperature、top-k、top-p 等采样参数调节,方便快速验证模型效果
核心亮点 完全本地隐私:数据和模型永远在你设备上 WebGPU 加速:需要 Chrome/Edge 等支持 WebGPU 的浏览器 + 较强 GPU(集成显卡也能跑小模型) 轻量实验向:适合学习、原型验证、小规模玩耍,不适合训百亿参数大模型 文件格式:自定义 .llm(含词汇表 + 权重)和 .bin 预分词文件,便于保存和复用
适用人群LLM 入门爱好者,想亲手从零实现 tokenizer + transformer 研究 tokenizer 对模型影响的学生/开发者 想在本地快速迭代小型领域模型的人 对 WebGPU、浏览器 AI 感兴趣的技术玩家
传送门:https://llm.istanbul
llm.istanbul — WebGPU LLM workbench
Source: https://llm.istanbul/
1 · Train a tokenizer
Build a Byte Pair Encoding vocabulary for your language. Drop text files, pick a vocab size, watch merges happen on your GPU. Save the\.json— Pre-tokenize feeds it to the transformer in step 3.
Training DataDrop files here orbrowse
Multiple files OK ·browse folderfor recursive scan
Shuffle paragraphs
Vocabulary Size InspectNo vocabulary loaded — train one above or load a .json
BPE Trainer ProfilerNo snapshots yet. Click “One-shot” or “Start Profiler” while training to capture per-kernel GPU timing.
Output Log
3 · Train a transformer
Two flows in one: pretrain a fresh foundation model on your\.bin, or load a\.llmcheckpoint and fine-tune it on a smaller, task-specific corpus. Forward, backward, and AdamW all run on your GPU — no server, no cloud.
EngineLLM engine not initialized
Dataset (.bin)Drop a.binfile orbrowse
Produced by the Pre-tokenize tab
Model Size Training Checkpoint
GPU ProfilerNo snapshots yet. Click “Snapshot Next Step” while training to capture per-kernel GPU timing.
Output Log
Generate from a model
Drop a\.llmcheckpoint, type a prompt, watch tokens stream. No\.binneeded — vocab + weights ride with the checkpoint. Useful for sanity-checking a run, comparing two checkpoints, or just playing with sampling knobs.
ModelNo model loaded — drop a .llm to begin
Generatetemptop-ktop-pmin-preptokens
相似文章
@NFTCPS: 4GB显存跑70B大模型?这事儿真成了! AirLLM玩了个骚操作——分层推理,不一次性把模型怼进显存,而是一层层加载、算完就扔,硬生生把巨无霸塞进小破卡。 最骚的是:100%开源,白嫖警告 https://github.com/0xSo…
AirLLM 是一个完全开源的工具,通过分层推理技术(逐层加载并立即释放显存),使得 70B 大语言模型可在仅 4GB 显存的 GPU 上运行,无需量化、蒸馏或剪枝,并已支持 Llama3.1 405B 在 8GB 显存上运行。
@zhixianio: 这两天新机器到了之后,我开始了「苦行僧」式的强迫自己使用本地模型来完成常见任务的修行 本以为会非常痛苦,没想到无论是速度还是质量都大大超出我的预期: 模型: Qwen3.6-35B-A3B-oQ6-fp16-mtp 运行:oMLX,开 N…
作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。
@iluciddreaming: 玩了两个月本地 LLM。 用 Windows 11 + llama.cpp + llama-swap 狂测各种开源模型,这是我的最终成绩单: 硬件:i7-13700 + 64GB RAM + RTX 4070 目前最能打的组合是 gemm…
经过两个月本地 LLM 测试,作者认为 gemma-4-12B-it-QAT 和 MTP 辅助组合在速度和可用性上表现最佳,硬件为 i7-13700 + 64GB RAM + RTX 4070。
WebLLM: 高性能浏览器内LLM推理引擎
WebLLM是一个高性能的浏览器内LLM推理引擎,它利用WebGPU进行硬件加速,并且完全兼容OpenAI API,使得开源语言模型可以在本地运行。
@FeitengLi: LLM 玩的好多技术 Povey 在 Zipformer 里都探索过
Z.ai 推出 GLM-5.3-Flash,这是一个具有 1M 代币上下文窗口的多模态 AI 模型,参数规模为 320B-A18B,并以 MIT 许可证发布。