model-optimization

标签

Cards List
#model-optimization

Show HN:以Fable质量一半的成本优化和服务模型

Hacker News Top · 2026-07-26 缓存

World Model Optimizer 是一款开源CLI工具,能够从智能体轨迹中优化AI模型,并通过路由器提供服务,在降低成本的同时保持前沿模型的质量。

0 人收藏 0 人点赞
#model-optimization

我们基于Hy3 295B的1位量化版本比云端API运行快2.2倍,且质量无损

Reddit r/LocalLLaMA · 2026-07-20

Hy3 295B模型的1位量化版本在推理速度上比云端API快2.2倍,且质量无损

0 人收藏 0 人点赞
#model-optimization

DFlash 使 Qwen3.6 27B 速度提升2.2倍,且质量无损

Reddit r/LocalLLaMA · 2026-07-16

DFlash 是一种方法,可将 Qwen3.6 27B 模型推理速度提升2.2倍,且质量无损失。

0 人收藏 0 人点赞
#model-optimization

@sakurayukiai: Gemma 4 每次 token 只激活约 4B 的 26B 权重,因此修复方案出奇地简单:将一个不支持的融合操作拆分为两个……

X AI KOLs Timeline · 2026-07-15

一个将融合操作拆分为两个矩阵乘法的修复方案,使 Gemma 4 能在使用了 13 年的双路 Xeon CPU 上以每秒 5.2 token 的速度运行,每次 token 仅使用 26B 权重中的 4B。

0 人收藏 0 人点赞
#model-optimization

@0xkeenz: 有意思,昨天刚好还在研究 Unsloth 和 NVIDIA 的 Qwen3.6 27B NVFP4 有什么区别,结果今天 Unsloth 就更新了! 新版 Unsloth 的量化思路和 NVIDIA 官方方案很类似:不再从 BF16 和 …

X AI KOLs Timeline · 2026-07-10 缓存

Unsloth 发布新版 Qwen3.6 27B NVFP4 量化方案,引入 FP8_E4M3 中间精度层并细化权重保护,在 24GB VRAM 上实现 2.5 倍速度提升,同时改进准确性和工具调用能力。

0 人收藏 0 人点赞
#model-optimization

面向边缘系统的延迟约束DNN架构学习:使用Zerorized Batch Normalization

arXiv cs.LG · 2026-07-09 缓存

本文提出了一种面向延迟的神经网络学习方法,使用Zerorized Batch Normalization优化严格延迟约束下边缘系统的DNN架构。实验表明,在NVIDIA Jetson设备上,该方法在精度损失极小的情况下显著降低了延迟。

0 人收藏 0 人点赞
#model-optimization

@akshay_pachaar: 你在Anthropic参加机器学习工程师面试。面试官问:"我们的模型在42秒内生成100个token。H…

X AI KOLs Timeline · 2026-07-07 缓存

解释了KV缓存如何通过消除注意力键和值的冗余重计算来加速LLM推理,在速度与内存之间进行权衡,并介绍了生产级缓存管理挑战。

0 人收藏 0 人点赞
#model-optimization

@DeRonin_: Fable 5 今晚离开你的计划,在它消失前偷走其‘大脑’.. 然后一个更便宜的模型为你保留输出……

X AI KOLs Timeline · 2026-07-07 缓存

一种捕获和重用 AI 模型输出的工作流策略,包括设置质量门槛、策略路线图、知识笔记和推理记录,以减少对前沿模型的依赖。

0 人收藏 0 人点赞
#model-optimization

LivePortrait 蒸馏模型可在浏览器中以25fps运行

Reddit r/LocalLLaMA · 2026-07-05 缓存

LivePortrait 已被蒸馏成一个模型,可直接在浏览器中以每秒25帧的速度运行,由 slperez 在 Hugging Face Spaces 演示中展示。

0 人收藏 0 人点赞
#model-optimization

使用“应用”让更小的模型在更大的任务中更有效。

Reddit r/LocalLLaMA · 2026-07-05

讨论如何通过应用提升小型AI模型在大型任务中的效果,兼顾效率与性能。

0 人收藏 0 人点赞
#model-optimization

一层足够吗?单个Transformer层即可媲美全参数RL训练

Hacker News Top · 2026-07-02 缓存

本文系统性地研究了LLM的RL后训练中每层的贡献,发现仅训练单个中间Transformer层即可恢复甚至超越全参数RL的性能提升,且在不同模型和任务上呈现一致模式。

0 人收藏 0 人点赞
#model-optimization

@MiaAI_lab: Nvidia又做到了!@NVIDIAAI的Qwen 3.6 27B NVFP4比Unsloth的Qwen 3.6 27B NVFP4在D…上快了约41%

X AI KOLs Timeline · 2026-06-30 缓存

Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。

0 人收藏 0 人点赞
#model-optimization

@MSFTResearch: AI智能体常常失败,因为它们的指令(或技能)是手动修改的,无法保证改进。Lea…

X AI KOLs Following · 2026-06-30 缓存

SkillOpt将AI智能体的技能编辑从手动修改转变为训练过程,在不改变模型权重的情况下提高智能体可靠性,并在多个基准测试中取得一致提升。

0 人收藏 0 人点赞
#model-optimization

@karminski3: DeepSeek真的是性价比和技术双重斩杀线... 有同学看不懂DSpark是啥, 简单给大家写个小教程讲讲. 推测性解码(投机解码)这个技术是用来提升大模型输出速度的. 本质是让小模型给大模型接话, 大模型判断小模型说的对不对. 因为现…

X AI KOLs Timeline · 2026-06-29 缓存

DeepSeek提出DSpark技术,通过在Final RMSNorm后插入微型Transformer实现推测性解码,将大模型输出速度提升60%-85%。

0 人收藏 0 人点赞
#model-optimization

压缩 Whisper large-v3-turbo 至 368 MB 采用 Q3_K 匹配的量化感知训练 — 多语言 WER 结果

Reddit r/openclaw · 2026-06-28

Whisper large-v3-turbo 已压缩至 368 MB,采用 Q3_K 匹配的量化感知训练,并报告了多语言词错误率结果。

0 人收藏 0 人点赞
#model-optimization

我弄清楚了‘超级权重’的成因

Reddit r/ArtificialInteligence · 2026-06-23

本文解释了大语言模型中的超级权重源于SoftMax与注意力机制的相互作用,该作用创建了一个充当稳定参考点的‘Nothing Dump’标记;移除这些权重会严重损害模型性能。

0 人收藏 0 人点赞
#model-optimization

@Zephyr271828: 你想要一个强大的小型LLM。是从头开始训练小模型,还是继承更大的模型?新论文:小型LLM:剪枝对比…

X AI KOLs Timeline · 2026-06-23 缓存

一篇新论文研究了是剪枝更大的LLM还是从头训练小LLM更好,发现剪枝不仅提供了良好的初始化。

0 人收藏 0 人点赞
#model-optimization

@eliebakouch: 在GLM-5上进行强化学习所需了解的所有基础设施内容 https://primeintellect.ai/blog/rl-at-1t-scale…

X AI KOLs Timeline · 2026-06-23 缓存

Prime Intellect发布了prime-rl v0.6.0,支持在万亿参数规模的大型Mixture-of-Experts模型上进行高效强化学习,实现低于5分钟的步骤时间,并对异步强化学习进行了优化。

0 人收藏 0 人点赞
#model-optimization

@RayFernando1337: “所选运行时使用NVFP4权重以获得最大性能。从原始FP8权重,我们进行了内部量…

X AI KOLs Following · 2026-06-23

讨论使用NVFP4 4位浮点权重以获得最大性能,通过使用NVIDIA ModelOpt从FP8进行内部量化实现,突出了该数据格式的双缩放因子以保持高动态范围。

0 人收藏 0 人点赞
#model-optimization

@jakevin7: 最近在看 GLM 5.2 相关的文档,发现一些有趣的内容分享一下。 GLM-5.2 用了 MTP(Multi-Token Prediction)来加速推理:用一个轻量的"草稿模型"先快速预测多个 token,再用大模型一次性验证,接受则跳…

X AI KOLs Following · 2026-06-19 缓存

GLM-5.2采用了MTP(Multi-Token Prediction)技术加速推理,并修复了GLM-5.1中MTP训练推理不一致导致的KV cache混用问题。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈