SupraLabs/Supra-Router-51M

Hugging Face Models Trending 模型

摘要

SupraLabs 发布了 Supra-Router-51M,这是一个拥有 5170 万个参数的微型 LLM,用于多任务基础设施路由,旨在决定是将提示词在边缘设备上本地处理还是发送到云端模型。在一个小型数据集上进行微调后,它使用多任务序列生成来实现稳健的路由。

任务: 文本生成 标签: transformers, safetensors, llama, 文本生成, 路由器, 编排器, SLM, 边缘计算, 混合专家模型, en, 数据集: SupraLabs/Prompt-Routing-Dataset, 基础模型: SupraLabs/Supra-1.5-50M-Base-exp, 基础模型: 微调版 SupraLabs/Supra-1.5-50M-Base-exp, 文本生成推理, 端点兼容, 区域: us
查看原文
查看缓存全文

缓存时间: 2026/07/09 19:38

SupraLabs/Supra-Router-51M · Hugging Face

来源:https://huggingface.co/SupraLabs/Supra-Router-51M

Supra-Router-51M · 多任务基础设施路由模型

logo (https://cdn-uploads.huggingface.co/production/uploads/697f2832c2c5e4daa93cece7/lClDSdp9BkKyv_VGWSQbt.png)

关于模型

Supra-Router-51M 是一款专为本地化边缘编排优化的超轻量、高速基础设施流量控制器。凭借仅 5170 万个参数,这个微型大语言模型充当着多模型生态系统的防御性网关,能够精确判断用户请求应由边缘小模型本地处理,还是需要分流到云端的前沿智能层。

该模型通过基于 SupraLabs/Prompt-Routing-Dataset(992 行数据)对预训练的 51M 基座模型进行微调而构建。它并非简单的二元分类器,而是采用多任务序列生成技术,在预测最终路由令牌之前先映射出提示词的底层属性,从而将注意力头锚定在稳健的语言和结构逻辑特征上。


https://huggingface.co/SupraLabs/Supra-Router-51M#multi-task-decision-sequence多任务决策序列

运行推理时,需将用户查询包裹在训练期间使用的结构化框架令牌内(Task: [Prompt]\nAnalysis:)。模型将输出一个确定性的、以管道符分隔的字符串,其中包含该提示词认知需求的完整遥测信息:

https://huggingface.co/SupraLabs/Supra-Router-51M#expected-output-target-schema预期输出目标模式:

Domain: [语义域] | Complexity: [1-5] | Math: [True/False] | Code: [True/False] | Route: [small model/big model] | Justification: [基于规则的基础设施推理]

https://huggingface.co/SupraLabs/Supra-Router-51M#why-this-works为何有效:

通过强制一个参数低于 1 亿的模型在输出最终路由令牌之前计算语义域、结构复杂度和技术标记,网络实际上运行了一个内部特征激活映射。这种多任务序列避免了局部权重坍塌,并保证了稳定的路由边界。

https://huggingface.co/SupraLabs/Supra-Router-51M#training-telemetry–optimization训练遥测与优化

  • 数据集来源:SupraLabs/Prompt-Routing-Dataset(992 个样本)
  • 训练时长:5 个 Epoch
  • 检查点选择:在第 3 个 Epoch(验证损失:0.1342)达到泛化峰值。为消除后期微型模型的记忆过拟合与验证漂移,训练状态在该数值峰值处自动回退并保存。
  • 精度:bfloat16
  • 硬件占用:优化后的序列处理长度为 3840 个令牌,确保推理速度极快,CPU/GPU 开销可忽略不计(亚毫秒级生成速度)。

https://huggingface.co/SupraLabs/Supra-Router-51M#inference–gateway-implementation推理与网关实现

使用以下直接脚本测试模型,或将其封装到生产级编排器或 FastAPI 网关中。它采用贪心解码(do_sample=False)以实现最大决策稳定性。

`` import torch from transformers import AutoModelForCausalLM, AutoTokenizer

MODEL_ID = “SupraLabs/Supra-Router-51M”

print(“[*] 正在初始化本地基础设施路由器…”) tokenizer = AutoTokenizer.from_pretrained(MODEL_ID) model = AutoModelForCausalLM.from_pretrained( MODEL_ID, dtype=torch.bfloat16, device_map=“auto” ) model.eval()

示例提示词,展示关键词陷阱规避

user_prompt = “Write a movie script about a chef who gets lost at sea.”

格式化以匹配内部SFT注意力对齐

formatted_input = f“Task: {user_prompt}\nAnalysis: “ inputs = tokenizer(formatted_input, return_tensors=“pt”).to(model.device)

with torch.no_grad(): outputs = model.generate( **inputs, max_new_tokens=128, do_sample=False, pad_token_id=tokenizer.pad_token_id, eos_token_id=tokenizer.eos_token_id )

generated_ids = outputs[0][inputs[“input_ids”].shape[1]:] print(tokenizer.decode(generated_ids, skip_special_tokens=True).strip()) ``

https://huggingface.co/SupraLabs/Supra-Router-51M#proven-benchmarks–defensive-boundaries经过验证的基准测试与防御边界

在边缘验证测试中,Supra-Router-51M 展现出对对抗性提示字符串的稳健抗性:

  • 关键词陷阱规避:成功识别语义上下文而非匹配令牌。包含诸如 “script” 或 “calculus” 等词的提示词会被正确解析为创意写作(而非编程/数学代码),并在复杂度较低时路由至本地小模型。
  • 复杂度驱动的安全网:在编程语法或技术边界不明确的情况下(例如复杂的正则表达式或架构数据库框架),模型会自然地将评估指标提升至复杂度:3,自动触发大模型路由覆盖。
  • 确定性卸载:安全捕获多步骤逻辑路径、微积分概念和代码生成脚本,并立即将其分配给云端规模的前沿端点。

相似文章

Arch-Router:将LLM路由与人类偏好对齐

Papers with Code Trending

Arch-Router是一个紧凑型1.5B参数模型,通过将查询映射到用户定义的领域和动作类型,将LLM路由与人类偏好对齐,在主观评估中优于专有模型。

[新发布] Supra-50M 正式推出!

Reddit r/LocalLLaMA

SupraLabs 发布了 Supra-50M,一个紧凑的 5000 万参数因果语言模型,包含基础版和指令版,基于 fineweb-edu 的 200 亿个 token 训练,在多项关键基准测试中达到了可与 GPT-2 和 SmolLM 等更大模型竞争的水平。