convaiinnovations/laya
摘要
Laya 是一款开源的非自回归决策模型,提供带有校准概率的类型化回答,旨在用于电子邮件分类和对话AI等任务,相比现有模型显示出显著的性能提升。
查看缓存全文
缓存时间: 2026/09/19 02:51
convaiinnovations/laya · Hugging Face
来源:https://huggingface.co/convaiinnovations/laya Laya 是一个开源的非自回归系统1决策模型:给它一个状态(文本、邮件、工单或JSON文档)和带类型的问题,它能返回带类型答案,并附有数学校准的概率与置信度分数。它从不生成文本,从而避免了解析错误和幻觉。
这是微调检查点,包含了专用的邮件分类(垃圾邮件、钓鱼邮件、部门路由)、对话轨迹建模(TD(λ=1.0))以及按基数进行的温度校准。
问题类型返回内容
choice:选定的选项、各选项概率、校准置信度
score:在您的顺序量表上的预期等级 (0, 1, 2…)、分布、置信度
noul:从 0.0 到 1.0 的校准布尔概率 P(true)
架构
- 主干网络:
ModernBERT-large(3.95亿参数,完全微调,双向),外加从零训练的决策头(2个Transformer层、选项标记评分器以及一个执行/升级头)。总参数量:4.21亿。 - 选项标记:每个选项在其自己的
[MASK]标记标记处被评分,然后对该问题的选项应用 softmax。 - 输入预算:每个问题512个标记(问题 + 选项 + 状态)。
- 多问题批处理:在单次前向传播中评估所有问题(在GPU上约需33到38毫秒)。
训练
使用 RLCD(基于校准决策的强化学习) 进行训练:策略网络输出概率分布,探索过程对 logits 添加零均值高斯噪声,奖励是一个严格适当的评分规则(对数分数 + 球面分数,顺序分数问题还加上排序概率分数)。只有当模型输出真实的、校准的概率时,才能获得最大期望奖励。
多轮对话使用带蒙特卡洛目标的时序差分学习(TD(λ=1.0))在前缀片段上进行,防止结果泄露。数据集100%来自人工标注的真实世界数据,零合成捷径。
- 训练:微调(7,313次更新,1个epoch,约1.96小时)
- 拟合的校准温度:[1.637, 1.251, 1.983](带按选项数量缩放)
基准测试:Laya 对比 TypeSafe Jev
Laya 基准测试对比
指标/维度TypeSafe Jev(已发布)Laya(微调检查点)分析/优势 P50 延迟(1个问题)约400毫秒平均值(70至500毫秒,最佳150毫秒)38.4毫秒(p95: 42.1毫秒)Laya平均快约10.4倍(比Jev的最佳情况快4倍) 批处理延迟(10个问题)约1,500毫秒(串行)/ 约400毫秒156.0毫秒(p95: 158.4毫秒)Laya评估10个问题的时间与Jev回答1个问题的时间相当 批处理延迟(50个问题)数秒 / 受速率限制721.4毫秒高吞吐量并行小批量处理 基准准确率****67.8%(跨4个生产工作流)83.8%任务内宏平均准确率Laya整体准确率高出16.0% 意图与客户路由约95%至98%一致性99.1%准确率(ECE: 0.009)路由任务上接近零的校准误差 内容审核与安全约92%至95%一致性96.7%准确率(ECE: 0.061)清晰的安全边界分离 推理与事实验证未单独报告88.3%准确率(ECE: 0.054)完全双向注意力捕获矛盾信息 指令遵循任务专有的内部数据集任务内87.8% / 零样本86.3%在未见过的任务上验证了泛化能力 邮件分类与钓鱼供应商定制工作流73.2%准确率(ECE: 0.017)定制的邮件清理和钓鱼过滤 选择性自动化(@ 50% 覆盖率)声称需要人工处理92.2%准确率(ECE: 0.041)安全的自动化门控(置信度 >= 0.85) 模型权重与代码闭源/专有API100% 开源 Apache 2.0完全的数据主权和透明度 推理成本0.042 / 百万输入标记(持续)**0.00 / 自托管可在消费级GPU、Mac MPS或CPU上运行 多轮轨迹建模静态状态快照TD(λ=1.0) 前缀建模真实的时间信用分配 部署模式仅云出口隔离网络/本地/设备端**零数据出口(符合HIPAA/GDPR)
评估结果(此检查点)
- **任务内测试集:**宏平均准确率 0.838,宏平均ECE 0.060
- **零样本(未见任务族):**宏平均准确率 0.651,宏平均ECE 0.207
- 关键任务族:
- 意图与路由:准确率 0.991,ECE 0.009
- 审核与安全:准确率 0.967,ECE 0.061
- 情感与语气:准确率 0.906,ECE 0.018
- 邮件分类与钓鱼:准确率 0.732,ECE 0.017
- 推理与事实核查:准确率 0.883,ECE 0.054
按任务族的详细结果、可靠性图和风险-覆盖率曲线位于本仓库的 eval/ 目录中。
快速开始 (pip install laya)
import laya
# 从 Hugging Face Hub 直接加载模型
agent = laya.load("convaiinnovations/laya")
state = {
"from": "[email protected]",
"subject": "Duplicate billing on March invoice #4411",
"body": "Hi team, we were billed twice for March. Please refund the duplicate before Friday or we will cancel our plan."
}
questions = {
"department": {
"type": "choice",
"instructions": "Which department should handle this email?",
"criteria": {
"billing": "invoices, payments, refunds",
"technical": "bugs, outages, integrations",
"sales": "pricing, contracts, demos",
"other": "everything else"
}
},
"urgency": {
"type": "score",
"instructions": "How urgent is this request?",
"criteria": ["not urgent", "soon", "critical deadline or blocking issue"]
},
"churn_risk": {
"type": "noul",
"instructions": "Does the user threaten to cancel or switch to a competitor?"
},
"is_phishing": {
"type": "noul",
"instructions": "Is this email a phishing or scam attempt?"
}
}
result = agent.predict(state, questions)
answers = result["answers"]
print("部门 :", answers["department"]["choice"], f"(置信度: {answers['department']['confidence']:.2f})")
print("紧急程度 :", f"{answers['urgency']['score']:.2f} / 2.0")
print("流失风险 :", f"{answers['churn_risk']['noul']:.1%}")
print("钓鱼邮件 :", f"{answers['is_phishing']['noul']:.1%}")
交互式 Web 演示
试试在线的 Gradio 空间:convaiinnovations/laya-demo (https://huggingface.co/spaces/convaiinnovations/laya-demo)
许可证和支持
由 Convai Innovations (https://huggingface.co/convaiinnovations) 根据 Apache 2.0 许可证发布,他们提供商业支持、企业集成和定制微调服务。
局限性
- 仅限文本,英语,每个问题512个标记(更长的状态将被截断)。
- 校准是在基准数据集上测量的;在全面自动化之前,请在您自己的数据分布上进行评估。
- 算术、计数、日期比较和多跳索引查找应保留在确定性代码中。
相似文章
Laya: Jev 的开源版本
Laya 是一个开源的快速多语言决策引擎,为结构化模式提供非自回归、校准概率,声称比 Jev 快 6-8 倍,并且完全开放。
laya.cpp: 优化的Laya近即时决策
laya.cpp 是一个优化的 C++ 实现,用于近即时决策,基于 ggml 构建并带有自定义 CUDA 内核,展示了在 Laya 模型上相比 Python 的显著速度提升。
@NFT_Chen: 什么?!一个仅0.6B的本地开源决策模型在Typed Decisions上超越了Laya!AgentJev-0.6B vs Laya: 准确率…
AgentJev-0.6B是一个小型开源AI决策模型,在Typed Decisions上超越了Laya,准确率更高,计算量显著减少,实现了更快的本地推理。
Laya (OS Jev) 在 Mac M4 CoreML 离线运行(每秒45次决策)
Laya 模型使用 CoreML 在苹果的 M4 芯片上离线运行,推理速度达到每秒45次决策。
@LinQ444: jev 与 laya 的对比 https://github.com/mizorewww/laya-mlx…
Laya-MLX是一个开源工具,用于在Apple Silicon上本地运行类型化决策AI模型,具有低延迟,提供无需云API的原生推理。它包括基准测试,显示在M3 Max等设备上的快速性能。