标签
一种名为JEVfire的新技术使现有的大型语言模型如Qwen在无需重训的情况下,通过修改决策过程来更像Jev,从而实现显著更快的JSON生成,并使本地AI代理能在消费级硬件上高效运行。
作者介绍了一种使用llama.cpp中的GBNF语法来约束本地AI模型输出、确保生成有效JSON的方法。构建了一个编译器,将工具模式转换为语法规则,并在每轮对话中缩小范围,只保留相关工具。
本文探索将大型推理教师模型(8B)蒸馏为小型学生模型(0.6B),用于端侧结构化文本增强,在实现大幅加速的同时恢复了显著的质量。研究发现,教师模型的推理能力而非其规模推动了摘要质量的提升,但同等规模的指令教师在某些文章上能产生更忠实的输出。
本文提出了动态填充锚点(DIA),一种适用于扩散大语言模型的免训练方法。该方法通过动态估计终止锚点位置来强制执行格式约束(如可解析的 JSON、推理模板),同时避免了固定跨度方法的僵硬性。实验表明,DIA 在 GSM8K 和 MATH 基准测试上取得了显著的零样本性能提升。
Outlines 是一个 Python 库,可确保在生成过程中从 LLM 获得结构化输出(JSON、Pydantic 模型等),跨多个模型提供商工作以消除解析错误。