SupersonicLabs/Julia-1 · Hugging Face

Reddit r/LocalLLaMA 模型

摘要

Julia 1 是一个拥有1.443亿参数的AI模型,用于分类、路由和决策任务。基准测试结果显示,它在如AG News和Emotion等明确选择任务上表现强劲,但在知识和推理方面存在局限性。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/27 03:40

SupersonicLabs/Julia-1 · Hugging Face

来源:https://huggingface.co/SupersonicLabs/Julia-1 Supersonic Labs 标志 (https://huggingface.co/SupersonicLabs/Julia-1/blob/main/assets/supersonic-labs-dark.svg)

从上下文到决策。

Julia 1 — 单色几何艺术作品 (https://huggingface.co/SupersonicLabs/Julia-1/blob/main/assets/julia-banner.png)

Julia 1 是 Julia 系列中的第一个模型,也是我们训练系统的首次公开测试。它拥有 1.443 亿参数,能够将一个状态、一个问题和一组可能的答案转化为一个清晰的决策。相同的接口可处理分类、路由、有序评分和布尔决策。

https://huggingface.co/SupersonicLabs/Julia-1#evaluation评估

于 2026-09-24 使用 H200 BF16 推理和严格编码进行测量。以下为本仓库中检查点的评估结果。

基准测试正确/总数Julia 1Jev 参考值差异
类型化决策1,463 / 2,00073.15%72.70%+0.45 个百分点
AG News · 4 标签94 / 10094.00%91.00%+3.00 个百分点
DAIR Emotion · 6 标签86 / 10086.00%48.00%+38.00 个百分点
Banking77 试点 · 72 标签64 / 10064.00%87.00%-23.00 个百分点

类型化准确率:选择 (Choice) 71.33% (428/600),无序列表 (Noul) 80.67% (484/600),评分 (Score) 68.88% (551/800)。

MASSIVE 场景分类正确/总数准确率
所有 52 种区域110,573 / 154,64871.50%
葡萄牙语 · pt-PT2,565 / 2,97486.25%
英语 · en-US2,580 / 2,97486.75%

MASSIVE 测试了 52 种区域下的 18 个场景标签,每种区域包含 2,974 个样本。它不评估意图分类或槽位填充。全区域数值为宏平均准确率。

协议: 类型化决策 (typed-decisions) (https://huggingface.co/datasets/LocalLLaMA/typed-decisions) 提供了 400 个测试用例;分类试点遵循固定的 Jev 基准测试协议 (https://github.com/AbdelStark/jev-benchmarks/tree/0d610cc53e79bcbec691312b0c4adb4a0e371642),使用 BTZSC (https://huggingface.co/datasets/btzsc/btzsc)。Jev 的数值作为对比参考提供,并非新的 Jev 运行。分类试点覆盖每个数据集 100 个样本。Banking 使用 72 标签的试点,通过排名/前 16 名短名单进行,而非原生 72 选项调用。弃权视为不正确。

完整基准测试结果 (https://huggingface.co/SupersonicLabs/Julia-1/blob/main/metrics/accuracy-20260924.json) · 检查点和验证来源 (https://huggingface.co/SupersonicLabs/Julia-1/blob/main/provenance.json)。

https://huggingface.co/SupersonicLabs/Julia-1#where-julia-is-accurate–and-where-it-can-missJulia 的准确之处 — 以及可能出错之处

Julia 1 展示了一个专注的 1.443 亿参数模型在任务为基于所提供上下文的明确选择时能做什么。它在 100 个 AG News 试点案例中选择了 94 个正确答案,在 100 个 Emotion 试点案例中选择了 86 个正确答案,并在所有 52 种 MASSIVE 区域中达到了 71.50% 的场景准确率。类型化决策套件达到了 73.15%。这些结果使得 Julia 适用于使用明确候选答案来测试分类和路由工作流。这也使这个首次发布成为我们训练系统的一个具体测试,展示了经过衡量的优势和可见的差距,而非对通用智能的承诺。

其权衡在于知识和多步推理。Julia 比较您提供的答案;不能指望它提供缺失的事实、求解代数方程式,或仅仅因为正确答案出现在选项中就进行长链计算。这些能力未通过此处的评估确立。措辞模糊、不熟悉的领域和长标签列表也可能导致错误:Banking77 试点使用短名单后达到 64/100,低于其提供的 87/100 参考值。100 样本的试点是积极的信号,而非新工作流的保证。请评估您计划使用的具体问题和选项。

https://huggingface.co/SupersonicLabs/Julia-1#why-a-decision-model-for-routing为何采用决策模型进行路由?

传统的规则或关键词路由器需要有人列举短语并维护分支顺序。Julia 则读取提供的上下文和候选答案的含义。一个模型可以为新的标签集评分,无需为每个工作流添加新的输出头,并且可以通过一个 API 处理 choice、有序的 score 和布尔型 noul 请求。

这是一个基于模型的决策,因此其答案取决于 state 中的证据和选项的措辞。请保持选项清晰明确,使用严格编码,并在用于重要操作之前根据您自己的工作流进行评估。分层的 Router 可以通过缩小分组和重新排序存活者来处理更大的 choice 列表,但每个原生模型调用仍然接受 2-20 个选项;分组结果并非全局概率分布。请参阅更大的选择集 (https://huggingface.co/SupersonicLabs/Julia-1/blob/main/julia/router/README.md#larger-choice-sets)。

https://huggingface.co/SupersonicLabs/Julia-1#from-mmbert-small-to-julia-1从 mmBERT-small 到 Julia 1

Julia 1 源自 JHU CLSP 的 mmBERT-small (https://huggingface.co/jhu-clsp/mmBERT-small),一个多语言 ModernBERT 编码器。上游模型是一个通用编码器,发布用于掩码语言建模和下游微调等任务。Julia 保留了该编码器基础和分词器,然后调整模型以针对关于状态的类型化问题对提供的答案选项进行评分。其检查点添加了一个决策头,并在决策格式的样本上训练;发布的产物包含由此产生的权重和推理代码,而非私有的训练流程。

特性mmBERT-smallJulia 1
主要接口编码器表示 / 掩码词建模state + question + 2-20 个 options → 一个选定的选项
参数量约 1.4 亿1.443 亿(包括决策组件)
上下文长度上游架构支持最多 8,192 个 token运行时支持最多 8,192 个组合 token;历史基准测试使用 1,024
输出用于下游任务的 token 或编码器特征按调用者选项顺序的分数和选定的答案
用途通用多语言编码器基础专业化的有限选择决策

mmBERT-small 的参数和上下文数据来自其模型卡 (https://huggingface.co/jhu-clsp/mmBERT-small)。Julia 的数值描述了此检查点及其评估的运行时,而非声称 mmBERT-small 本身仅限于 Julia 的接口。Julia 不是聊天或文本生成模型,不能与 AutoModelForMaskedLM 互换。

https://huggingface.co/SupersonicLabs/Julia-1#webgpu-and-onnxWebGPU 与 ONNX

独立的 Julia-1-ONNX 仓库 (https://huggingface.co/SupersonicLabs/Julia-1-ONNX) 包含完整的 ONNX 导出和 JavaScript WebGPU 适配器。它加载模型一次,在内存中预热,并通过 ONNX Runtime WebGPU 运行推理。WebGPU 适配器源码和 Rust N-API/WebAssembly 分词器位于该仓库中。

https://huggingface.co/SupersonicLabs/Julia-1#start-here从这里开始

需要 Python 3.11+。标准 PyTorch 安装即可支持 CPU 推理;无需构建原生路由器。下载完整仓库(包括其 550.5 MiB 检查点),然后安装其 Python 包:

python -m pip install huggingface_hub
python -c "from huggingface_hub import snapshot_download; snapshot_download('SupersonicLabs/Julia-1', local_dir='Julia-1')"
python -m pip install -e ./Julia-1

根目录下的 config.json 描述了检查点文件,并作为 Hugging Face 下载统计 (https://huggingface.co/docs/hub/models-download-stats) 的标准查询文件。上面的完整仓库下载包含它。Hub 在服务器端统计请求;Julia 不添加任何遥测或额外的跟踪请求。仅下载 model.safetensors 不受此基于配置的计数覆盖,并且显示的计数并非唯一用户数。原生运行时继续读取 julia_config.json;此清单不会使 Julia 成为 Transformers AutoModel。

在请求之间保持模型加载状态:

from julia import load_model

engine = load_model(
    "Julia-1",
    device="cpu",
    strict_encoding=True,
    max_length=8192,
    head_length=512,
)

result = engine.predict(
    state="I was charged twice for the same order.",
    questions={
        "team": {
            "type": "choice",
            "instructions": "Which team should handle this request?",
            "criteria": {
                "billing": "Billing and payment disputes",
                "shipping": "Shipping and delivery",
                "access": "Account access and login",
            },
        },
    },
)
print(result["answers"]["team"]["choice"])
print(result["answers"]["team"]["probabilities"])

Julia 1 和 Dumont 支持相同的命名问题接口:predict(state=..., questions=...)。调用者定义的 ID(如 billing)原样返回。命名标签是两个模型都支持的 API 功能,并非 Dumont 独有的能力。

类型标准答案
choice2-20 个 ID 到非空描述的映射choice:获胜的 ID
score2-20 个评分标准描述的有序列表score:预期的零基索引
noul可选地将 false 和 true 映射到描述;省略的标准使用字面的 false/truenoul:为真的概率

每个命名答案都包含 type 和 probabilities,对于选择型问题,按键使用调用者 ID;对于评分型问题,按键使用零基字符串;对于布尔决策,按键使用 false/true。选择和评分还包含 max_probability。这些是完整的 softmax 概概率,未经显示舍入;它们不保证确定性。问题在批次中独立评分。

Julia 1 原生的 2-20 选项限制仍然适用。运行时默认使用检查点的 8,192 个 token 的组合状态/问题/选项限制。示例使用了 512 个 token 的问题和选项预算;每个选项有 48 个 token 的限制。严格编码会拒绝溢出。上面的历史准确率基准测试使用了 1,024 个 token。一次 8,192 个 token 的 CPU 冒烟测试 (https://huggingface.co/SupersonicLabs/Julia-1/blob/main/metrics/context-8k-smoke.json) 已通过;8k 任务的准确率尚未确立。

https://huggingface.co/SupersonicLabs/Julia-1#reproduce-typed-decision-accuracy复现类型化决策准确率

python -m pip install -e '.[benchmark]'
python scripts/reproduce_typed.py --output benchmark/typed-cpu --literal-noul-ablation

使用下载的真实权重从本模型仓库运行。使用新的输出文件夹。该脚本会验证发布的权重哈希值,下载固定的测试 Parquet 文件并检查其 SHA-256,然后为所有 400 个用例 / 2,000 个问题写入预测和 CPU 结果。--dataset PATH 可重用本地副本。可选的消融实验还会使用字面的 false/true 描述评估布尔问题。

数据集版本:c76749ec58bd8c3d2ea706b31c333a9059c38f90。测试 Parquet SHA-256:4f294f218ea1da27f3efef936359389c62ea4d3973a41457732990f1d31b647c。

保留数据集的 criteria 描述,包括 false/true 顺序的布尔描述。只有没有布尔标准的问题才使用字面的 false 和 true。准确率使用所有三种类型中概率最高的选项;不要对评分 API 的预期索引进行舍入。未在测试数据上拟合阈值。

600 个布尔问题中有 400 个具有描述性标准。命名问题 API 的早期版本错误地丢弃了这些描述;底层基准测试保留了它们。API 现在会保留提供的描述,而没有标准的问题则保持其现有的字面 false/true 行为。

历史报告使用 CUDA BF16;此测试环境运行 CPU FP32 并记录自己的结果。它不会重新生成不相关的分类或 MASSIVE 指标。

2026年9月26日的 CPU FP32 复现(torch 2.14.0,transformers 5.0.0,仅标记头禁用)结果为 选择型 426/600,评分型 542/800,无序列表型 483/600。上面的历史 CUDA BF16 总数保持独立;较小的 CPU/GPU 预测差异尚未被隔离到单一原因。仅将布尔描述替换为字面的 false/true 在同一 CPU 运行中复现了 无序列表型 391/600。请参阅配对的 CPU 结果 (https://huggingface.co/SupersonicLabs/Julia-1/blob/main/metrics/typed-cpu-20260926.json)。

https://huggingface.co/SupersonicLabs/Julia-1#existing-list-api现有列表 API

现有接口仍然受支持:

result = engine.predict([{
    "state": "I was charged twice.",
    "question": "Which team should handle this request?",
    "options": ["Billing", "Shipping", "Account access"],
    "type": "choice",
}])[0]
print(result["index"])

这种旧形式为每个请求返回一个带有 index 和显示格式化的 probabilities 的结果。probabilities=False 仅返回索引。其历史显示舍入保持不变。使用 engine.logits(rows) 获取原始分数,或使用命名问题接口获取完整的 softmax 概概率。对于旧的 noul 请求,先提供 false,后提供 true;评分选项必须有序。

当 PyTorch 检测到支持 BF16 的 GPU 时,可通过 device="cuda" 使用 CUDA。在启动 Python 前设置 JULIA_CPU_THREADS 以调整 CPU 线程数(默认:4)。请参阅运行时详情 (https://huggingface.co/SupersonicLabs/Julia-1/blob/main/julia/router/README.md)。

https://huggingface.co/SupersonicLabs/Julia-1#limits-and-deployment-notes限制与部署说明

  • FP32 权重占用 550.5 MiB;需为分词器和激活值预留额外内存。CPU 推理无需 GPU。
  • 原生请求接受 2-20 个选项。分组路由在缩窄过程中可能丢失正确答案,且其最终概率仅覆盖最终候选项。
  • 基准测试结果不能确立在新领域、每种语言或高风险用例上的准确性。Banking 试点低于其提供的参考值。
  • julia/ 中的 Python 运行时是必需的。本仓库不是可直接使用的 Transformers 文本分类管道或生成模型。
  • 下载实际权重,而非 Git LFS 指针。在引擎加载期间,请勿更改检查点文件。

模型产物在 Apache 2.0 许可下提供。训练流程不包含在此仓库中。


Supersonic Labs

相似文章

Apodex-1.1-mini-GGUF*Hugging Face

Reddit r/LocalLLaMA

Apodex-1.1 是一款专注于优先推理的 AI 模型,专为复杂的长期研究任务设计,支持端到端执行、自适应智能体团队,并内置验证机制以提供可验证的结果。

IFM/K2-Horizon-MoVA-36B-A4B-GGUF · Hugging Face

Reddit r/LocalLLaMA

这是K2-Horizon-MoVA-36B-A4B模型的GGUF版本,一个具有36B总参数和每令牌4B活动参数的混合专家AI模型,针对llama.cpp使用进行了优化。它在代理和推理基准测试中展示了前沿级别的性能,与更大和封闭的模型竞争。

IQuestLab/IQuest-Q1 · Hugging Face

Reddit r/LocalLLaMA

IQuest-Q1 是一个由IQuest开发的混合专家AI模型,拥有3200亿参数,用于智能体编码、推理和多步骤工具使用,在各种基准测试中表现出色。