标签
一种名为JEVfire的新技术使现有的大型语言模型如Qwen在无需重训的情况下,通过修改决策过程来更像Jev,从而实现显著更快的JSON生成,并使本地AI代理能在消费级硬件上高效运行。
CoVeR 是一种基于覆盖的路由方法,在代理检索系统中将 LLM 验证器调用减少了 62-68%,同时在多跳问答基准上保持准确性。
ClusterFewshot是一种新颖的方法,通过集成语义聚类和效用评分来改进大语言模型工作流中的少样本示范选择,从而降低优化成本并提高基于DSPy的管道的准确性。
OptiSkill是一个框架,用于构建一个层级式与演进式的技能库,以支持基于LLM的运营研究建模,通过存储和验证跨问题的可重用技能来提高公式化准确性。
本文提供了10个步骤来优化AI智能体决策,通过使用langchain-typesafe工具,将LLM调用成本降低至每百万令牌0.042美元,延迟降至70-500毫秒,同时防止幻觉。
D-Quant 是一种灵活的 KV 缓存量化框架,采用可漂移熵编码将可变长度表示转换为固定大小的比特流,从而在注意力内核中实现高效的并行反量化,并实现高达 7 倍的内存减少和 3.5 倍的吞吐量提升,同时保持接近 BF16 的性能。
COBRA-Skills 提出了一种通过上下文赌博机和进化算子优化智能体技能的方法,在多个 AI 智能体基准测试中实现了 55-58% 的优化成本降低。
NVIDIA的论文介绍了一种在AI模型之间传输KV缓存的方法,使目标模型可以完全跳过预填充阶段,并实现2.7到25倍更快的转换速度,这可能会提高多模型应用的效率。
本巨型帖子汇总了专注于优化推理、效率和可访问性的最新开源项目、研究论文及硬件创新,针对开源LLM及相关技术。
Apple的Lily引擎通过利用统一内存和硬件,优化了Apple silicon上的设备端LLM推理,性能超越MLX-LM,并针对Qwen3.6-35B-A3B模型架构进行了调优。
OpenFreedom 的 Dynamic Thinking 功能相比 OpenClaw,将任务成本降低了 86%,执行时间减少了 80%,同时 LLM 调用次数减少了 74%,并保持质量。
LLM4LLM引入了一个部署感知的闭环优化框架,用于桥接内核基准测试和实际LLM推理,在H100 GPU上实现了高达6.98倍的加速。
作者描述了一种Token路由系统,用于优化大语言模型的使用,通过基于成本的路由、提示缓存和输出规范等技术,将API成本降低了高达70%。
LambLabs推出Woolly,一种后训练技术,可加速Qwen3-8B在数学和编程任务上的表现达2-3倍,使其能够在他们的芯片上运行,并提供现场演示。
Inco AI 宣布 DFlash 2,这是一项下一代解码技术,可在 M5 Max MacBook Pro 上为 Qwen3.8-27B 实现高达 4.6 倍的速度提升,提高效率而不改变输出。
斯坦福和MIT的研究论文表明,围绕LLMs优化Python工具链可以带来高达6倍的性能差距,而无需更改模型权重,类似Meta-Harness的系统能够自动化上下文进化。
本文提出了一种基于执行的监督强化学习方法,用于引导小众多语言代码翻译,并引入了新基准HumanEval-X++,使用Qwen-3.5模型展示了相比基线显著的改进。
一位开发者创建了一个任务感知的 GGUF 量化流水线,利用张量级比特分配,在手调 imatrix 基础上将 Gemma 4 12B Q3 的编码性能提升了 8.55%,而模型大小仅增加了 0.119%。
解释了为什么智能体 API 费用会随上下文长度呈二次方增长——因为每一轮都会重新读取完整历史,并分享了一些实用技巧,比如让工具结果过期、缩小工具 schema、压缩上下文来降低成本。
提出了一种面向LLM的两阶段结构化剪枝框架,通过多目标深度剪枝和并行贝叶斯优化联合优化延迟与模型大小,在边缘部署中实现有利的权衡。