convaiinnovations/laya

Hugging Face Models Trending 模型

摘要

Laya 是一款开源的非自回归决策模型,提供带有校准概率的类型化回答,旨在用于电子邮件分类和对话AI等任务,相比现有模型显示出显著的性能提升。

任务:强化学习 标签:transformers, safetensors, laya, rl-agent, system-one, 校准决策, rlcd, 分类, 路由, 评分, 强化学习, 商业使用, license:apache-2.0, endpoints_compatible, 区域:美国
查看原文
查看缓存全文

缓存时间: 2026/09/19 02:51

convaiinnovations/laya · Hugging Face

来源:https://huggingface.co/convaiinnovations/laya Laya 是一个开源的非自回归系统1决策模型:给它一个状态(文本、邮件、工单或JSON文档)和带类型的问题,它能返回带类型答案,并附有数学校准的概率与置信度分数。它从不生成文本,从而避免了解析错误和幻觉。

这是微调检查点,包含了专用的邮件分类(垃圾邮件、钓鱼邮件、部门路由)、对话轨迹建模(TD(λ=1.0))以及按基数进行的温度校准。

问题类型返回内容 choice:选定的选项、各选项概率、校准置信度 score:在您的顺序量表上的预期等级 (0, 1, 2…)、分布、置信度 noul:从 0.0 到 1.0 的校准布尔概率 P(true)

架构

  • 主干网络ModernBERT-large(3.95亿参数,完全微调,双向),外加从零训练的决策头(2个Transformer层、选项标记评分器以及一个执行/升级头)。总参数量:4.21亿。
  • 选项标记:每个选项在其自己的 [MASK] 标记标记处被评分,然后对该问题的选项应用 softmax。
  • 输入预算:每个问题512个标记(问题 + 选项 + 状态)。
  • 多问题批处理:在单次前向传播中评估所有问题(在GPU上约需33到38毫秒)。

训练

使用 RLCD(基于校准决策的强化学习) 进行训练:策略网络输出概率分布,探索过程对 logits 添加零均值高斯噪声,奖励是一个严格适当的评分规则(对数分数 + 球面分数,顺序分数问题还加上排序概率分数)。只有当模型输出真实的、校准的概率时,才能获得最大期望奖励。

多轮对话使用带蒙特卡洛目标的时序差分学习(TD(λ=1.0))在前缀片段上进行,防止结果泄露。数据集100%来自人工标注的真实世界数据,零合成捷径。

  • 训练:微调(7,313次更新,1个epoch,约1.96小时)
  • 拟合的校准温度:[1.637, 1.251, 1.983](带按选项数量缩放)

基准测试:Laya 对比 TypeSafe Jev

Laya 基准测试对比

指标/维度TypeSafe Jev(已发布)Laya(微调检查点)分析/优势 P50 延迟(1个问题)约400毫秒平均值(70至500毫秒,最佳150毫秒)38.4毫秒(p95: 42.1毫秒)Laya平均快约10.4倍(比Jev的最佳情况快4倍) 批处理延迟(10个问题)约1,500毫秒(串行)/ 约400毫秒156.0毫秒(p95: 158.4毫秒)Laya评估10个问题的时间与Jev回答1个问题的时间相当 批处理延迟(50个问题)数秒 / 受速率限制721.4毫秒高吞吐量并行小批量处理 基准准确率****67.8%(跨4个生产工作流)83.8%任务内宏平均准确率Laya整体准确率高出16.0% 意图与客户路由约95%至98%一致性99.1%准确率(ECE: 0.009)路由任务上接近零的校准误差 内容审核与安全约92%至95%一致性96.7%准确率(ECE: 0.061)清晰的安全边界分离 推理与事实验证未单独报告88.3%准确率(ECE: 0.054)完全双向注意力捕获矛盾信息 指令遵循任务专有的内部数据集任务内87.8% / 零样本86.3%在未见过的任务上验证了泛化能力 邮件分类与钓鱼供应商定制工作流73.2%准确率(ECE: 0.017)定制的邮件清理和钓鱼过滤 选择性自动化(@ 50% 覆盖率)声称需要人工处理92.2%准确率(ECE: 0.041)安全的自动化门控(置信度 >= 0.85) 模型权重与代码闭源/专有API100% 开源 Apache 2.0完全的数据主权和透明度 推理成本0.042 / 百万输入标记(持续)**0.00 / 自托管可在消费级GPU、Mac MPS或CPU上运行 多轮轨迹建模静态状态快照TD(λ=1.0) 前缀建模真实的时间信用分配 部署模式仅云出口隔离网络/本地/设备端**零数据出口(符合HIPAA/GDPR)

评估结果(此检查点)

  • **任务内测试集:**宏平均准确率 0.838,宏平均ECE 0.060
  • **零样本(未见任务族):**宏平均准确率 0.651,宏平均ECE 0.207
  • 关键任务族:
    • 意图与路由:准确率 0.991,ECE 0.009
    • 审核与安全:准确率 0.967,ECE 0.061
    • 情感与语气:准确率 0.906,ECE 0.018
    • 邮件分类与钓鱼:准确率 0.732,ECE 0.017
    • 推理与事实核查:准确率 0.883,ECE 0.054

按任务族的详细结果、可靠性图和风险-覆盖率曲线位于本仓库的 eval/ 目录中。

快速开始 (pip install laya)

import laya

# 从 Hugging Face Hub 直接加载模型
agent = laya.load("convaiinnovations/laya")

state = {
    "from": "[email protected]",
    "subject": "Duplicate billing on March invoice #4411",
    "body": "Hi team, we were billed twice for March. Please refund the duplicate before Friday or we will cancel our plan."
}

questions = {
    "department": {
        "type": "choice",
        "instructions": "Which department should handle this email?",
        "criteria": {
            "billing": "invoices, payments, refunds",
            "technical": "bugs, outages, integrations",
            "sales": "pricing, contracts, demos",
            "other": "everything else"
        }
    },
    "urgency": {
        "type": "score",
        "instructions": "How urgent is this request?",
        "criteria": ["not urgent", "soon", "critical deadline or blocking issue"]
    },
    "churn_risk": {
        "type": "noul",
        "instructions": "Does the user threaten to cancel or switch to a competitor?"
    },
    "is_phishing": {
        "type": "noul",
        "instructions": "Is this email a phishing or scam attempt?"
    }
}

result = agent.predict(state, questions)
answers = result["answers"]

print("部门     :", answers["department"]["choice"], f"(置信度: {answers['department']['confidence']:.2f})")
print("紧急程度  :", f"{answers['urgency']['score']:.2f} / 2.0")
print("流失风险  :", f"{answers['churn_risk']['noul']:.1%}")
print("钓鱼邮件  :", f"{answers['is_phishing']['noul']:.1%}")

交互式 Web 演示

试试在线的 Gradio 空间:convaiinnovations/laya-demo (https://huggingface.co/spaces/convaiinnovations/laya-demo)

许可证和支持

由 Convai Innovations (https://huggingface.co/convaiinnovations) 根据 Apache 2.0 许可证发布,他们提供商业支持、企业集成和定制微调服务。

局限性

  • 仅限文本,英语,每个问题512个标记(更长的状态将被截断)。
  • 校准是在基准数据集上测量的;在全面自动化之前,请在您自己的数据分布上进行评估。
  • 算术、计数、日期比较和多跳索引查找应保留在确定性代码中。

相似文章

Laya: Jev 的开源版本

Hacker News Top

Laya 是一个开源的快速多语言决策引擎,为结构化模式提供非自回归、校准概率,声称比 Jev 快 6-8 倍,并且完全开放。

laya.cpp: 优化的Laya近即时决策

Reddit r/LocalLLaMA

laya.cpp 是一个优化的 C++ 实现,用于近即时决策,基于 ggml 构建并带有自定义 CUDA 内核,展示了在 Laya 模型上相比 Python 的显著速度提升。