model-weights

标签

Cards List
#model-weights

HF 探索出售:对开源模型的影响?

Reddit r/LocalLLaMA · 2026-08-26

Hugging Face 正在探索以约 130 亿美元估值出售,引发对开源模型政策可能变化的担忧,原因是第三方投资和盈利关注。

0 人收藏 0 人点赞
#model-weights

GLM 5.3 权重。它或许提供最佳的容量与规模比。

Reddit r/LocalLLaMA · 2026-08-14

GLM 5.3 模型权重的发布,指出其可能具有出色的容量与规模比,并将在量化后进行评测。

0 人收藏 0 人点赞
#model-weights

@casper_hansen_:如果 Muse Spark 1.2 采用 Apache 2.0 许可证,并且确实是一个不靠刷榜的优秀模型,我就会填写道歉表格…

X AI KOLs Following · 2026-08-10 缓存

一位用户对 Meta 宣布开源 Muse Glimmer 以及即将推出的 Muse Spark 1.2 做出回应,称如果 Spark 1.2 采用 Apache 2.0 许可证且确实很出色,他就会道歉。

0 人收藏 0 人点赞
#model-weights

@rohanpaul_ai:Google DeepMind新论文。模型权重不必再是只能微调或平均化的静态工件……

X AI KOLs Following · 2026-08-02 缓存

谷歌DeepMind的新论文SkillSmith将前缀键值缓存视为一种输入模态,在推理时把文本知识与现有权重组合成冻结的Gemma 3 4B模型的新前缀缓存,从而无需针对特定目标的训练运行即可改进适应能力。

0 人收藏 0 人点赞
#model-weights

@omarsar0:谷歌DeepMind的新研究。(收藏它)SkillSmith将模型权重视为LLM可原生读取的额外模态……

X AI KOLs Following · 2026-08-02 缓存

谷歌DeepMind推出SkillSmith,将模型权重视为LLM可以原生推理的额外模态,从而实现指令引导的参数化合成,在推理时组合技能。该方法优于仅文本和仅权重的基线方法。

0 人收藏 0 人点赞
#model-weights

二十五年前是密码学,如今是模型权重

Hacker News Top · 2026-07-28 缓存

一篇将当今AI模型权重出口管制与1990年代密码战争进行对比的文章,援引OpenAI的封禁漏洞以及防御者使用中国开源权重模型的事例,主张限制措施反而损害安全。

0 人收藏 0 人点赞
#model-weights

Ernos Labs AI Archive:一个免费的自托管开放模型权重存档

Reddit r/singularity · 2026-07-28 缓存

Ernos Labs 推出一个免费的自托管存档,用于保存开放AI模型权重,强调去中心化和非单一实体所有。

0 人收藏 0 人点赞
#model-weights

ModelExpress:以光速分发模型制品(12分钟阅读)

TLDR AI · 2026-07-27 缓存

NVIDIA 推出了 ModelExpress,该工具利用 GPU 到 GPU 的 RDMA 传输和优化的存储流式传输,加速了跨 GPU 集群的模型制品分发,将 DeepSeek-V4 Pro 等大型模型的启动时间从 8 分钟缩短至不到 2 分钟。

0 人收藏 0 人点赞
#model-weights

第二个 K3 的权重发布了,我正在下载完整的 FP16 并藏在床垫里

Reddit r/LocalLLaMA · 2026-07-22

一位用户发推文说正在下载第二个 K3 模型的完整 FP16 权重并储存起来,开玩笑地让其他人别锁门。

0 人收藏 0 人点赞
#model-weights

高带宽闪存为模型权重提供高效存储

Hacker News Top · 2026-07-15 缓存

IEEE Spectrum报道了高带宽闪存(HBF),这是一种新型内存技术,通过使用高带宽内存(HBM)封装技术堆叠NAND闪存芯片,大幅提升读取带宽,实现对LLM模型权重的高效存储。首批产品预计约一年内推出。

0 人收藏 0 人点赞
#model-weights

@brianbellx: 我在不对模型做任何改变的情况下,从 GLM-5.2 中移除了 423 GB。1,403 GB → 980 GB。753B 权重。逐比特精确。无需量化…

X AI KOLs Timeline · 2026-07-12 缓存

一种无需量化或重新训练即可从 GLM-5.2(753B 权重)中移除 423 GB 的技术,通过在 VRAM 中保持权重压缩状态实现逐比特精确压缩。

0 人收藏 0 人点赞
#model-weights

@0xkeenz: 今天验证了一个纠结很久的事情 Qwen3.6 27B 官方原模型是 BF16 权重,但一些量化版本,比如 cyankiwi / Unsloth,会把部分关键权重转换成 FP16 而不是保持 BF16。BF16 和 FP16 在存储占用上是…

X AI KOLs Timeline · 2026-07-08 缓存

作者验证了Qwen3.6 27B模型权重从BF16转换为FP16不会导致数值溢出,并指出FP16尾数精度更高,解释了量化版本为何使用FP16而非保持BF16。

0 人收藏 0 人点赞
#model-weights

流程感知自进化: 协同进化模型权重、流程与任务解决方案

arXiv cs.AI · 2026-07-07 缓存

HASE 是一个强化学习框架,它在统一的智能体过程中协同进化模型权重、任务解决方案以及流程组件(引导与评估),使单个8B参数的模型在文本分类和阿尔法因子挖掘任务上能够匹配更大系统的性能。

0 人收藏 0 人点赞
#model-weights

LingBot-Vision: 基于掩码边界建模的自监督预训练 (在1.1B参数下NYUv2线性探测RMSE为0.296,对比DINOv3-7B的0.309,在ImageNet上稍逊一筹);提供四种尺寸的权重[R]

Reddit r/MachineLearning · 2026-07-06

LingBot-Vision引入了掩码边界建模用于自监督预训练,在1.1B参数下NYUv2线性探测上达到0.296 RMSE,而DINOv3-7B为0.309,虽然在ImageNet上表现稍逊;已发布四种尺寸的权重。

0 人收藏 0 人点赞
#model-weights

Longcat 2模型权重已发布

Reddit r/LocalLLaMA · 2026-07-03

美团已发布Longcat 2.0的权重,在Hugging Face上提供INT8和FP8格式。

0 人收藏 0 人点赞
#model-weights

Anthropic 与中文开放权重 AI 的争论

Reddit r/ArtificialInteligence · 2026-07-02

Alex Karp 认为,对企业来说,真正的 AI 安全意味着对数据和模型权重的控制,并批评 Anthropic 通过推出与客户竞争的产品来捕获下游价值的策略。文章将开放权重模型之争定位为商业问题而非安全问题。

0 人收藏 0 人点赞
#model-weights

@0x0SojalSec: 开放LLM的海盗湾,模型权重可通过种子下载。我们的下一个选项正在等待中

X AI KOLs Timeline · 2026-07-02 缓存

一条推文宣布了一个基于种子的网站,用于下载开放LLM模型权重,将其定位为开放模型的海盗湾替代品。

0 人收藏 0 人点赞
#model-weights

@ClementDelangue: 不是你的权重,就不是你的大脑!

X AI KOLs Following · 2026-07-02

Clement Delangue 发推文强调拥有AI模型权重的重要性,指出如果你不拥有它们,你就没有拥有你的大脑。

0 人收藏 0 人点赞
#model-weights

谷歌不断流失顶尖AI研究人员,护城河从来就不是权重

Reddit r/artificial · 2026-06-26

谷歌顶尖AI研究人员,包括Shazeer和John Jumper,正跳槽到竞争对手,表明真正的资产是人才而非模型权重。文章建议不要依赖任何单一的AI模型提供商。

0 人收藏 0 人点赞
#model-weights

2-bit QAT 模型发布

Reddit r/LocalLLaMA · 2026-06-07

关于2位量化感知训练(QAT)在更大规模MoE模型上的潜力的讨论,比较其与4位QAT及三元LLM的性能,并探讨在消费级硬件上的可行性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈