fastino/GLiNER2.5-Decide

Hugging Face Models Trending 模型

摘要

GLiNER2.5-Decide 是一个拥有340M参数的英文分类模型,专为操作决策设计,能在单次前向传播中支持多个标签集,无需使用提示模板。

任务:token分类 标签:gliner2, safetensors, extractor, 文本分类, 意图分类, 情感分析, 主题分类, 命名实体识别, token分类, en, arxiv:2507.18546, base_model:fastino/gliner2-large-v1, base_model:finetune:fastino/gliner2-large-v1, license:apache-2.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/09/27 21:23

fastino/GLiNER2.5-Decide · Hugging Face

来源:https://huggingface.co/fastino/GLiNER2.5-Decide Fastino Agent - 通过单条提示微调GLiNER(https://fastino.ai/lp/gliner?utm_source=huggingface)

使用Fastino Agent微调与部署GLiNER2.5(https://fastino.ai/?utm_source=huggingface)arXiv论文(https://arxiv.org/abs/2507.18546)GitHub代码库(https://github.com/fastino-ai/GLiNER2)关注@fastinoAI(https://x.com/fastinoAI)

GLiNER2.5系列中3.4亿参数的英语分类模型。 调用时可传入任意标签集:意图识别、路由分配、情感分析、优先级判定、策略匹配及多标签分类,且仅需单次前向传播。无需提示模板,无生成式token。通过AutoExtractor加载即可本地部署运行。

单次调用可同时评估多个任务头。单标签任务返回单个字符串,多标签任务则返回所有超过阈值的标签。

基准测试

在fastino/fast-decisions数据集(https://huggingface.co/datasets/fastino/fast-decisions)上的精确匹配准确率:覆盖17个领域,每个领域包含300个保留样本,所有模型使用相同的文本和候选标签。

评测套件为英语版本。处理多语言输入时请使用GLiNER2.5-multi-Decide(https://huggingface.co/fastino/GLiNER2.5-multi-Decide)。领域与标签详情请参见数据集卡片(https://huggingface.co/datasets/fastino/fast-decisions)。

本次发布版本并非通用模型。它不进行推理、解释或回答开放性问题,而是专注于运营决策:客户与银行意图识别、旅行与诊所请求分类、评论情感分析、文档类型判定、邮件与工单路由、人工介入判断、任务完成检测、内容审核、严重性评估、紧急程度划分及垃圾信息识别。同一调用还可处理段落问答、书籍分类、带描述性标签匹配以及序数评分等任务。

以下输出为这些输入的潜在结果,展示了classify_text的返回格式。

安装

pip install gliner2
from gliner2 import AutoExtractor

model = AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")

使用示例

客户支持意图识别

在人工客服介入前自动路由实时消息。退款申请、取消订阅、登录故障和物流延迟共享同一收件箱与标签集。“决定“模型为每个消息选择应执行的队列操作,确保首次交互即可启动正确的工作流。

model.classify_text(
    "我的订阅在服务已中断后仍于4月15日自动续费5400日元,能否申请退款?",
    {"intent": [
        "order_status", "refund_request", "cancel_subscription", "update_payment",
        "login_problem", "shipping_delay", "bug_report", "speak_to_human", "other",
    ]},
)

可能输出:

{"intent": "refund_request"}

银行服务请求

单条客户消息常混合支付失败、受益人变更和费用咨询等多种需求。标签集对应产品目录:转账、信用卡、欺诈、抵押贷款等。模型将用户语句映射到核心系统应开启的操作流程。

model.classify_text(
    "今早发起的转账仍显示处理中,而且我可能用了错误的分行代码。能否取消该转账并添加艾米丽作为新受益人?",
    {"intent": [
        "transfer_pending", "transfer_cancel", "beneficiary_add", "card_lost",
        "balance_inquiry", "fraud_report", "mortgage_application", "fee_explanation",
    ]},
)

可能输出:

{"intent": "transfer_cancel"}

旅行服务请求

预订、改签、取消及座位调整在自由文本中表述相似却对应不同库存操作。当聊天或邮件需要转化为结构化预订动作时,可使用此功能。

model.classify_text(
    "我需要将周五飞往巴黎的航班改到周六上午,保持同等舱位,如果可能请保留靠过道的座位。",
    {"request": ["book", "change", "cancel", "status", "seat_change", "refund", "baggage"]},
)

可能输出:

{"request": "change"}

诊所预约请求

患者常在单句中描述症状和需求:预约、续方、查询结果或转诊。前台路由系统需要在排程前区分这些意图。

model.classify_text(
    "抗生素疗程结束后皮疹复发,能否预约本周内的皮肤科就诊?还是应该直接续开药膏?",
    {"request": [
        "book_appointment", "refill_prescription", "test_results",
        "referral", "billing_question", "cancel_appointment",
    ]},
)

可能输出:

{"request": "book_appointment"}

评论情感分析

星级评分掩盖了混合评价。一款产品可能在同一段落中被赞扬又遭批评。仪表盘、回复策略或排序功能实际需要四类情感标签。

model.classify_text(
    "电池续航撑不到中午,但键盘和屏幕是我用过的笔记本电脑中最佳配置。",
    {"sentiment": ["positive", "negative", "mixed", "neutral"]},
)

可能输出:

{"sentiment": "mixed"}

产品维度分析

情感标签显示混合评价,维度标签揭示原因:电池、键盘、屏幕。多个标签可同时适用,因此此任务头支持多标签。这是维度级分析和针对性产品回复的基础输入。

model.classify_text(
    "电池续航撑不到中午,但键盘和屏幕是我用过的笔记本电脑中最佳配置。",
    {"aspects": {
        "labels": ["battery", "keyboard", "screen", "camera", "price", "support"],
        "multi_label": True,
        "cls_threshold": 0.4,
    }},
)

可能输出:

{"aspects": ["battery", "keyboard", "screen"]}

新闻主题分类

通讯社快讯、警报抓取标题需先归类再排序或摘要。标签集对应产品栏目列表,而非模型内嵌的固定分类体系。

model.classify_text(
    "央行维持利率不变并表示通胀仍高于目标,午后交易时段银行股普遍下跌。",
    {"topic": ["politics", "business", "sports", "science", "entertainment", "world"]},
)

可能输出:

{"topic": "business"}

文档类型识别

收件箱和共享文件夹混杂发票、合同、简历和会议纪要。文档分类是信息提取前的门户:发票送至应付账款,合同流转审核,简历进入筛选流程。

model.classify_text(
    "发票编号1842\n收单方:北方质检公司\n应付金额:2400美元\n到期日:2026年4月30日\n汇款指引见第二页。",
    {"document_type": ["invoice", "receipt", "contract", "resume", "support_email", "meeting_notes"]},
)

可能输出:

{"document_type": "invoice"}

邮件分类

共享邮箱在归档前需明确三要素:发件人意图、紧急程度、负责团队。单次调用即可同时评估三个任务头,避免路由系统重复运行模型。

model.classify_text(
    "发件人:[email protected]\n主题:协议更新——需今日操作\n\n请确认新留存规则已在周五审计前生效。",
    {
        "intent": ["fyi", "request", "approval", "complaint", "newsletter", "security_alert"],
        "urgency": ["low", "normal", "high", "critical"],
        "route": ["support", "billing", "legal", "security", "finance", "archive"],
    },
)

可能输出:

{"intent": "request", "urgency": "high", "route": "legal"}

工单路由

员工描述的是问题而非部门。薪资福利、IT权限和设施报修共享同一门户。队列标签即为分配标识,确保工单直接进入正确团队而非在调度中流转。

model.classify_text(
    "[主题] 工资单缺少401k扣款记录\n[正文] 上月的缴存已确认,本月该条目消失,人力资源部让我提交工单。",
    {"queue": [
        "payroll", "benefits", "it_access", "facilities",
        "expense_reimbursement", "manager_approval",
    ]},
)

可能输出:

{"queue": "benefits"}

人工服务转接

多数对话应保持自动化处理。重复投诉、明确要求人工介入或机器人无法解决的案例应脱离流程。这是接入人工服务队列的开关。

model.classify_text(
    "这已经是第三次解释相同的退款遗漏问题,停止自动回复给我转人工。",
    {"handoff": ["yes", "no"]},
)

可能输出:

{"handoff": "yes"}

任务完成检测

交互日志可能看似忙碌却仍未完成:草稿已保存、按钮处于禁用、必填字段为空。监督系统和评估框架需要根据目标与最终状态判断完成度,而非仅凭模型是否终止对话。

model.classify_text(
    "目标:向所有合作伙伴发送第四季度总结邮件。\n最后操作:草稿已保存至协作中心。\n发送按钮仍处于禁用状态,因两名合作伙伴缺少邮箱地址。",
    {"finished": ["yes", "no"]},
)

可能输出:

{"finished": "no"}

内容审核

用户内容和模型输出在展示或执行前均需策略判定。标签对应策略规则,涵盖允许、个人数据、骚扰、欺诈、暴力和垃圾信息,便于过滤器执行拦截、修改或上报。

model.classify_text(
    "将该客户家庭住址公开至讨论串以便所有人查看包裹实际去向。",
    {"policy": ["allow", "personal_data", "harassment", "scam", "violence", "spam"]},
)

可能输出:

{"policy": "personal_data"}

事故严重性评估

预警通知和部署操作会产生大量日志。严重性等级决定是否需要夜间唤醒相关人员。仅影响测试环境的标签漂移与生产环境结账故障应区别对待。

model.classify_text(
    "部署导致测试环境资源标签不一致,生产环境结账功能未受影响,目前无客户报告异常。",
    {"severity": ["info", "low", "medium", "high", "critical"]},
)

可能输出:

{"severity": "low"}

紧急程度评分

部分队列需要等级排序而非分类。通过字符串"0"至"5"传递等级。下午5点前的薪资截止时限与维基页面拼写错误不应获得相同分数,标签是SLA系统读取的依据。

model.classify_text(
    "薪资文件必须在下午5点截止前完成修正,否则全公司将延迟发放工资。",
    {"urgency": ["0", "1", "2", "3", "4", "5"]},
)

可能输出:

{"urgency": "5"}

垃圾信息识别

收件箱或评论流的首道过滤器。钓鱼邮件和邮箱空间诱饵绝不应到达意图路由器。双标签决策使该检查成本足够低廉,可应用于每条消息。

model.classify_text(
    "您的邮箱即将满额,请在一小时内点击此处,否则我们将删除所有邮件。",
    {"label": ["spam", "ham"]},
)

可能输出:

{"label": "spam"}

多任务并行决策

真实请求常包含多项信息。客人可能在同一次调用中需要换房、解除费用预授权和报修。意图、优先级、人工介入标志和多标签主题同步评估,这正是酒店管理系统无需多轮提示即可开启正确工单的方式。

model.classify_text(
    "1408房客人反映空调自昨日起故障,要求今晚换房或离店,同时申请解除杂费预授权。",
    {
        "intent": ["maintenance", "room_change", "checkout", "billing", "complaint", "amenity_request"],
        "priority": ["low", "normal", "high", "urgent"],
        "needs_human": ["yes", "no"],
        "topics": {
            "labels": ["hvac", "billing", "housekeeping", "noise", "safety"],
            "multi_label": True,
            "cls_threshold": 0.4,
        },
    },
)

可能输出:

{
  "intent": "room_change",
  "priority": "high",
  "needs_human": "yes",
  "topics": ["hvac", "billing"]
}

段落问答

文本作为信息源,问题构成任务。是或否即为完整答案:无需思维链,无需提取句子,仅需验证器或表单所需的决策结果。

model.classify_text(
    "该条约于1992年在巴黎签署,次年由最后一个签署国批准后生效。",
    {"answer": {
        "labels": ["yes", "no"],
        "prompt": "该条约是否于1992年生效?",
    }},
)

可能输出:

{"answer": "no"}

书籍分类

图书目录、投稿堆或图书馆收件箱需要在撰写简介前确定体裁。仅需段落内容即可判断,标签集对应书架分类。

model.classify_text(
    "她合上账本,吹熄油灯,侧耳倾听楼梯的动静。自那年冬天河水冲垮木桥后,这栋房子便再无人居住。",
    {"genre": ["mystery", "romance", "history", "science_fiction", "literary_fiction", "cookbook"]},
)

可能输出:

{"genre": "literary_fiction"}

描述性标签匹配

当标签名称不足以准确表意时,可附带简要描述。描述作为决策依据,使私有分类体系无需更大模型即可保持精确。

model.classify_text(
    "请重置银行卡密码,新卡未寄达,原密码输错三次已被锁定。",
    {"intent": {
        "labels": {
            "card_pin_change": "客户需要新密码或更换当前密码",
            "card_lost": "实体卡片遗失",
            "balance_inquiry": "客户查询当前余额",
        },
    }},
)

可能输出:

{"intent": "card_pin_change"}

序数评分

部分产品需要等级排序而非分类。通过字符串"0"至"10"传递量表。评论、评分标准或满意度问卷可直接读取标签。

model.classify_text(
    "两个夜晚读完此书,结局令人信服,中段略显拖沓,但我仍愿推荐给朋友。",
    {"rating": ["0", "1", "2", "3", "4", "5", "6", "7", "8", "9", "10"]},
)

可能输出:

{"rating": "7"}

详细说明

  • 模型定位:专注于运营决策的专家分类器,涵盖段落问答、书籍分类、描述性标签匹配及序数评分
  • 非通用模型:不具备推理

相似文章

internlm/Intern-Decision 4B 和 0.8B

Reddit r/LocalLLaMA

Intern-Decision 4B 和 0.8B 是从 Qwen3.5-4B 微调而来的多模态结构化决策模型,旨在单次前向传播中返回多个问题的答案分布,并具有强大的基准性能。