tokenizer

标签

Cards List
#tokenizer

Claude Sonnet 5 预计今日晚些时候发布,但可能不如 Opus 4.8 出色

Reddit r/singularity · 2026-06-30

Claude Sonnet 5 可能于今日晚些时候发布,配备新的分词器、高分辨率视觉,并以 Sonnet 价格提供接近 Opus 的性能作为卖点,但可能不会超越 Opus 4.8。

0 人收藏 0 人点赞
#tokenizer

BrainG3N: 一种用于可控3D脑部MRI生成的双用途分词器

arXiv cs.AI · 2026-06-20 缓存

介绍了BrainG3N,一种用于3D脑部MRI潜在扩散的双用途分词器,它使用冻结的掩码自编码器(MAE)编码器生成临床信息丰富的嵌入表示,并使用CNN解码器进行重建,在23个任务的基准测试中达到了最先进性能,并实现了可控生成和纵向预测。

0 人收藏 0 人点赞
#tokenizer

quicktok: 一个更快的分词器(与tiktoken精确且字节一致)[P]

Reddit r/MachineLearning · 2026-06-16

quicktok 是一个快速且精确的 BPE 分词器,用 C++ 编写,与 tiktoken 字节一致,比现有替代方案快 2–11 倍。支持 cl100k、o200k、GPT-OSS、Llama-3 和 Qwen2.5/3 编码器。

0 人收藏 0 人点赞
#tokenizer

@PierceZhang34: 10秒训练一个小模型! LLM 训练神器:http://llm.istanbul 初体验 最近发现了一个超级有趣的开源风格工具网站 —— http://llm.istanbul,它号称 WebGPU LLM Workbench,意思是完全…

X AI KOLs Timeline · 2026-06-12 缓存

介绍了一个名为 llm.istanbul 的 WebGPU LLM 工作台,可在浏览器中训练小模型、训练分词器并生成文本。无需服务器,完全本地运行。

0 人收藏 0 人点赞
#tokenizer

时间序列即语言:面向通用时间序列基础模型的通用分词器

arXiv cs.LG · 2026-06-10 缓存

本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。

0 人收藏 0 人点赞
#tokenizer

MiniCPM5 1B - 这是什么?

Reddit r/LocalLLaMA · 2026-06-01

MiniCPM5-1B 是 OpenBMB 推出的一款新型小语言模型,据称是从头构建的,拥有自己的分词器和独特行为,作为一款功能强大的 1B 模型引发了热议。

0 人收藏 0 人点赞
#tokenizer

由zhangtao2-1添加MiniCPM5分词器支持 · Pull Request #23384 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-05-27 缓存

此Pull Request为llama.cpp添加了MiniCPM5分词器支持,扩展了该工具对MiniCPM模型系列的兼容性。

0 人收藏 0 人点赞
#tokenizer

[新发布] Supra-50M 正式推出!

Reddit r/LocalLLaMA · 2026-05-22

SupraLabs 发布了 Supra-50M,一个紧凑的 5000 万参数因果语言模型,包含基础版和指令版,基于 fineweb-edu 的 200 亿个 token 训练,在多项关键基准测试中达到了可与 GPT-2 和 SmolLM 等更大模型竞争的水平。

0 人收藏 0 人点赞
#tokenizer

ztok —— 一个用 Zig 编写的高性能多线程分词器,支持加载 tiktoken / HF / SentencePiece,速度提升 2–5 倍

Reddit r/LocalLLaMA · 2026-05-22

ztok 是一个用 Zig 编写的高性能多线程分词器库,支持多种格式(tiktoken、HF、SentencePiece 等),速度比现有方案快 2–5 倍,适用于 RAG 分块和数据集分词。

0 人收藏 0 人点赞
#tokenizer

@lvwerra:我们正在发布Carbon:一个快得离谱的DNA模型。Carbon比第二好的模型快275倍。快到你可以处理……

X AI KOLs Following · 2026-05-19 缓存

HuggingFace发布了Carbon,一个DNA模型,比之前的最先进模型(Evo2)快275倍,使得在单个GPU上不到两天就能处理整个人类基因组。该模型使用了独特的tokenizer,将序列分割成6碱基的块,同时保持单碱基分辨率,并附带一个交互式演示。

0 人收藏 0 人点赞
#tokenizer

数值感知嵌入

Reddit r/LocalLLaMA · 2026-05-19

一种通过重写分词器和MLM微调来使嵌入模型感知数字顺序的技术,在数字排序基准上达到59%的准确率。

0 人收藏 0 人点赞
#tokenizer

The biggest AI breakthrough in medicine & drug discovery

Reddit r/singularity · 2026-05-14 缓存

MAML is a novel multi-modal AI model that unifies understanding of chemistry, genetics, and proteins, outperforming specialized models on 11 drug discovery benchmarks, promising to accelerate pharmaceutical research and improve success rates.

0 人收藏 0 人点赞
#tokenizer

针对数据中心的攻击、各种尺寸的Qwen3.5、DeepSeek与华为的合作、Apple的多模态分词器

The Batch · 2026-03-20 缓存

Andrew Ng的时事通讯涵盖了近期AI发展,包括针对数据中心的攻击、各种尺寸的Qwen3.5的发布、DeepSeek与华为的合作、Apple的多模态分词器,以及对AI驱动的就业不确定性和地缘政治风险的反思。

0 人收藏 0 人点赞
#tokenizer

shiyu-coder/Kronos

GitHub Trending (daily) · 2026-05-14 缓存

Kronos 是一个面向金融K线序列的开源基础模型,基于全球超过45家交易所的数据训练而成。它采用专用分词器和仅解码器Transformer架构,已被AAAI 2026接收。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈