stuntd:一个基于Laya的本地Jev兼容服务器,可从您自己的流量中学习(无需API密钥)

Reddit r/LocalLLaMA 工具

摘要

stuntd 是一个本地代理服务器,可从您的流量中学习,使用Laya模型在本地提供类型化的LLM决策,兼容Jev协议且无需API密钥。

它是什么。stuntd 是一个用于类型化LLM决策的本地代理:选择、是/否、评分。您的应用通过它继续调用其提供者。stuntd 记录决策,在Laya(开源权重的System One模型;编码器保持冻结)上训练一个小头部,在影子模式下提供服务,仅在达到您的目标时与提供者一致后切换为实时。在置信度阈值以下,请求仍会发送给提供者。如果一致性下降,它会自我降级。它还支持Jev协议。将typesafe-sdk指向http://127.0.0.1:8787,Laya会在本地零样本响应POST /v1/systemone,无需密钥。在其后放置任何Jev兼容服务器(付费API、kev、SemIf、LLM2Jev、laya-server),它会从该服务器的答案中学习,直到能够自行回答。为什么。Jev 快速且优秀,但它是一个托管API:往返约380毫秒,按令牌付费,早期访问。Laya 是开源的,在笔记本电脑GPU上约22毫秒响应,但零样本时当标签集较大时会失效:在banking77(77个意图)上得分38%,而Jev得分76%(数据来自dhruvmehra/jevbench)。在您自己的流量上训练的头部可以缩小这一差距,并且之前没有人将其整合到具有回退循环的代理中。快速开始,本地Jev,无需密钥:pip install "stuntd[train]" stuntd config init stuntd serve 客户端:TypeSafeClient(api_key="anything", base_url="http://127.0.0.1:8787")。数据(RTX 5060笔记本电脑,所有内容均可从仓库重现;所有教师都是规则或神谕,因为我没有Jev密钥):头部答案p50:22毫秒CUDA,60毫秒CPU,通过TCP守护进程28毫秒。Snake,BFS神谕作为教师,相同种子:零样本Laya每局得分0.7;经过30局教师和138秒训练后,头部自行处理99.6%的移动,得分11.4(神谕:21)。README中的并排GIF。支持分类(每个请求3个问题):与教师的零样本一致性为69/34/66%,训练后为99/86/98%,在默认0.99目标下90%的问题在本地回答。超过12个标签的银行意图:零样本89.5%,训练后100%。编码代理的命令门(允许/询问/拒绝):零样本45%,训练后97%,本地96%。训练每个站点缓存一次冻结编码器的输出,因此3000行数据上24个周期需要2到6分钟。它不是什么。它只学习封闭决策,从不学习自由文本。编码器是冻结的,因此它学习单词中的内容,而不是字段上的算术:写为"amount > X"的风险规则得分为0.42;写为"first transfer to this payee, larger than usual"的同一规则得分为0.94。目前,Anthropic、Responses和Gemini流量未受影响。每次服务都加载1.6 GB的检查点。还包括:一个20行的PreToolUse钩子,在Claude Code运行shell命令之前询问本地command_gate问题。仓库:https://github.com/bladedevoff/stuntd, Apache-2.0。我希望听到您管道中哪些决策是封闭选择的,以及您是否会将其交给一个20毫秒的本地模型。
查看原文

相似文章

Laya: Jev 的开源版本

Hacker News Top

Laya 是一个开源的快速多语言决策引擎,为结构化模式提供非自回归、校准概率,声称比 Jev 快 6-8 倍,并且完全开放。

DIY Jev

Reddit r/LocalLLaMA

作者分享了一个类似DIY Jev的推理设置,使用开源权重大语言模型,展示了通过简单的提示和基于logit的验证,在没有微调的情况下实现了良好的准确性,并提供了一个用于本地部署的Rust Web服务器。