llm-optimization

标签

Cards List
#llm-optimization

@TeksEdge: 有人让普通Qwen的行为非常接近Jev,而无需训练新模型。顶级Jev克隆(根据HF…

X AI KOLs Timeline ↗ · 昨天 缓存

一种名为JEVfire的新技术使现有的大型语言模型如Qwen在无需重训的情况下,通过修改决策过程来更像Jev,从而实现显著更快的JSON生成,并使本地AI代理能在消费级硬件上高效运行。

0 人收藏 0 人点赞
#llm-optimization

CoVeR:代理检索中基于覆盖的验证器调用路由

arXiv cs.CL ↗ · 昨天 缓存

CoVeR 是一种基于覆盖的路由方法,在代理检索系统中将 LLM 验证器调用减少了 62-68%,同时在多跳问答基准上保持准确性。

0 人收藏 0 人点赞
#llm-optimization

ClusterFewshot:提升大语言模型工作流中的少样本优化

arXiv cs.CL ↗ · 昨天 缓存

ClusterFewshot是一种新颖的方法,通过集成语义聚类和效用评分来改进大语言模型工作流中的少样本示范选择,从而降低优化成本并提高基于DSPy的管道的准确性。

0 人收藏 0 人点赞
#llm-optimization

OptiSkill:基于LLM的优化建模的层级式与演进式技能库

arXiv cs.AI ↗ · 昨天 缓存

OptiSkill是一个框架,用于构建一个层级式与演进式的技能库,以支持基于LLM的运营研究建模,通过存储和验证跨问题的可重用技能来提高公式化准确性。

0 人收藏 0 人点赞
#llm-optimization

推文:@0xCarnagee https://x.com/0xCarnagee/status/2101019382009004249

X AI KOLs Timeline ↗ · 6天前 缓存

本文提供了10个步骤来优化AI智能体决策,通过使用langchain-typesafe工具,将LLM调用成本降低至每百万令牌0.042美元,延迟降至70-500毫秒,同时防止幻觉。

0 人收藏 0 人点赞
#llm-optimization

D-Quant:面向 KV 缓存量化的可漂移熵编码

arXiv cs.CL ↗ · 6天前 缓存

D-Quant 是一种灵活的 KV 缓存量化框架,采用可漂移熵编码将可变长度表示转换为固定大小的比特流,从而在注意力内核中实现高效的并行反量化,并实现高达 7 倍的内存减少和 3.5 倍的吞吐量提升,同时保持接近 BF16 的性能。

0 人收藏 0 人点赞
#llm-optimization

COBRA-Skills:上下文赌博机引导的智能体技能优化进化

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

COBRA-Skills 提出了一种通过上下文赌博机和进化算子优化智能体技能的方法,在多个 AI 智能体基准测试中实现了 55-58% 的优化成本降低。

0 人收藏 0 人点赞
#llm-optimization

@somi_ai: 如果这个有效,你就不用每个应用都选一个模型了。便宜的模型处理无聊的任务。遇到困难的任务时,你把整个对话交给大模型,它不需要重新阅读。

X AI KOLs Timeline ↗ · 2026-09-08 缓存

NVIDIA的论文介绍了一种在AI模型之间传输KV缓存的方法,使目标模型可以完全跳过预填充阶段,并实现2.7到25倍更快的转换速度,这可能会提高多模型应用的效率。

0 人收藏 0 人点赞
#llm-optimization

汇总最新开源项目、研究论文,助力开源LLM及相关硬件、软件的优化、效率与可访问性?

Reddit r/LocalLLaMA ↗ · 2026-09-03

本巨型帖子汇总了专注于优化推理、效率和可访问性的最新开源项目、研究论文及硬件创新,针对开源LLM及相关技术。

0 人收藏 0 人点赞
#llm-optimization

优化Apple Silicon设备端推理(20分钟阅读)

TLDR AI ↗ · 2026-09-02

Apple的Lily引擎通过利用统一内存和硬件,优化了Apple silicon上的设备端LLM推理,性能超越MLX-LM,并针对Qwen3.6-35B-A3B模型架构进行了调优。

0 人收藏 0 人点赞
#llm-optimization

Dynamic Thinking

Reddit r/ArtificialInteligence ↗ · 2026-08-27

OpenFreedom 的 Dynamic Thinking 功能相比 OpenClaw,将任务成本降低了 86%,执行时间减少了 80%,同时 LLM 调用次数减少了 74%,并保持质量。

0 人收藏 0 人点赞
#llm-optimization

LLM4LLM:通过闭环智能体优化桥接内核基准测试与实际部署

arXiv cs.AI ↗ · 2026-08-25 缓存

LLM4LLM引入了一个部署感知的闭环优化框架,用于桥接内核基准测试和实际LLM推理,在H100 GPU上实现了高达6.98倍的加速。

0 人收藏 0 人点赞
#llm-optimization

@DeRonin_: 我构建了一个系统来无限制地运行大语言模型...我的Token Router,这就是为什么Claude Code每天运行超过10小时,并且我的API费…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

作者描述了一种Token路由系统,用于优化大语言模型的使用,通过基于成本的路由、提示缓存和输出规范等技术,将API成本降低了高达70%。

0 人收藏 0 人点赞
#llm-optimization

@LambLabs:认识Woolly 我们通过后训练使Qwen3-8B在数学和编程提示上运行速度提升2-3倍,更重要的是,使其能够适配…

X AI KOLs Timeline ↗ · 2026-08-21 缓存

LambLabs推出Woolly,一种后训练技术,可加速Qwen3-8B在数学和编程任务上的表现达2-3倍,使其能够在他们的芯片上运行,并提供现场演示。

0 人收藏 0 人点赞
#llm-optimization

@inco_ai: 希望您喜欢我们的首次发布!(更多精彩即将呈现)

X AI KOLs Timeline ↗ · 2026-08-18 缓存

Inco AI 宣布 DFlash 2,这是一项下一代解码技术,可在 M5 Max MacBook Pro 上为 Qwen3.8-27B 实现高达 4.6 倍的速度提升,提高效率而不改变输出。

0 人收藏 0 人点赞
#llm-optimization

@marfinxx: 斯坦福和MIT的这篇论文真是疯狂 一篇新研究论文证明,围绕……优化Python工具链可以……

X AI KOLs Timeline ↗ · 2026-08-18 缓存

斯坦福和MIT的研究论文表明,围绕LLMs优化Python工具链可以带来高达6倍的性能差距,而无需更改模型权重,类似Meta-Harness的系统能够自动化上下文进化。

0 人收藏 0 人点赞
#llm-optimization

利用基于执行的可验证监督引导小众多语言代码翻译的强化学习方法

arXiv cs.CL ↗ · 2026-08-17 缓存

本文提出了一种基于执行的监督强化学习方法,用于引导小众多语言代码翻译,并引入了新基准HumanEval-X++,使用Qwen-3.5模型展示了相比基线显著的改进。

0 人收藏 0 人点赞
#llm-optimization

Gemma 4 12B Q3:通过张量级量化分配实现 +8.55% 编码性能提升

Reddit r/LocalLLaMA ↗ · 2026-08-13

一位开发者创建了一个任务感知的 GGUF 量化流水线,利用张量级比特分配,在手调 imatrix 基础上将 Gemma 4 12B Q3 的编码性能提升了 8.55%,而模型大小仅增加了 0.119%。

0 人收藏 0 人点赞
#llm-optimization

你的智能体不贵,贵的是上下文窗口。算笔账

Reddit r/AI_Agents ↗ · 2026-08-10

解释了为什么智能体 API 费用会随上下文长度呈二次方增长——因为每一轮都会重新读取完整历史,并分享了一些实用技巧,比如让工具结果过期、缩小工具 schema、压缩上下文来降低成本。

0 人收藏 0 人点赞
#llm-optimization

面向延迟和模型大小优化的LLM多目标结构化剪枝

arXiv cs.AI ↗ · 2026-07-28 缓存

提出了一种面向LLM的两阶段结构化剪枝框架,通过多目标深度剪枝和并行贝叶斯优化联合优化延迟与模型大小,在边缘部署中实现有利的权衡。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈