为Jev制作了使用RLCD的通用开源模型,并且它超越了所有Jev基准测试。HF空间、基准测试、模型、仓库

Reddit r/LocalLLaMA 模型

摘要

本文宣布了Laya的发布,这是一个使用RLCD训练的开源4.21亿参数非自回归决策模型,它超越了Jev基准测试,并可在Hugging Face上进行测试。

感谢出色的支持(https://www.reddit.com/r/LocalLLaMA/comments/1wijo3e/i_literally_built_the_jev_architecture_one_year/)以及数十个请求,希望制作一个通用模型、运行基准测试并创建HF空间,以便任何人都可以测试。所以,这里给你们。我在一个大型数据语料库上训练了一个改进的模型,现在称为Laya。它在单张RTX 6000 Pro(96 GB VRAM)上训练;模型架构是一个421M参数的非自回归决策模型,配对一个双向ModernBERT-large编码器和一个从头训练的Transformer头,用于对[MASK]选项标记进行评分,以在单个约35毫秒前向传播中解析类型化模式。数据集是一个100%人工标注的语料库,包含超过25,000个真实世界示例,涵盖意图路由、事实核查、审核共识、提示护栏、评分标准和多轮对话轨迹,没有合成数据捷径。我所做的RLCD(非官方,顺便说一句)是一种策略梯度强化学习方法,有点像针对严格适当评分规则优化决策模型,确保只有在输出真实的、数学校准的概率时才能获得最大奖励。注意:它可以运行在低端PC上,因为它是一个小型的421M模型,欢呼HF空间尝试:https://huggingface.co/spaces/convaiinnovations/laya-demo GitHub仓库:https://github.com/NandhaKishorM/laya HF仓库:https://huggingface.co/convaiinnovations/laya感谢所有支持我、分享故事、发送私人消息的人。当然,它需要更多改进。如果有人想请我喝咖啡,这里是链接:https://github.com/NandhaKishorM
查看原文

相似文章