Tired of RAM prices, so I have been pooling spare RAM across old devices to run bigger local models

Reddit r/LocalLLaMA 工具

摘要

This article demonstrates how to pool RAM from old devices to run a larger local AI model and build a private chatbot using custom knowledge from PDFs, ensuring all data remains local.

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/25 03:17

**TL;DR:** 通过池化旧设备的闲置RAM来运行更大的本地模型,构建一个使用私有数据的私有聊天机器人。 ## 背景与目标 在视频中,分享者介绍了RAM deck的一个绝佳用例——如何构建一个私有聊天机器人。这个聊天机器人使用用户拥有的、机密的数据进行训练,所有数据都保留在本地硬件中,不会上传到云端。适用场景包括研究人员处理研究论文、学者管理庞大数据库,或者企业主拥有需要输入本地模型的商业机密信息。 ## 分布式模型运行 当前演示使用了一个30B模型。由于迷你PC(mini PC)的内存不足以独立承载如此大的模型,模型被分布式运行在迷你PC和Mac Mini之间。具体分配如下: - 迷你PC分配了12GB RAM。 - Mac Mini分配了约5.5GB RAM。 这种池化提供了相当不错的性能:每秒生成约30到30几个token,延迟很低,大约1秒,令人印象深刻。 ## 训练聊天机器人 分享者想询问模型关于一种最近获批用于罕见病症的药物信息,例如名为“Aurora”的药物。最初,模型对这些信息一无所知。 接下来,分享者从互联网下载了相关论文PDF,例如关于“corometus”治疗淀粉样变性心肌病的文章。目的是将这些PDF输入给模型,让它学习疾病或药物信息。 具体过程: 1. PDF被提交给RAM deck协调器。 2. 协调器将PDF分片,并托管在集群中计算设备的RAM中(而非SSD或存储设备),以确保聊天机器人能快速高效地访问知识。 3. 在迷你PC上指定为存储节点,但PDF分片分布在所有设备的RAM中。 完成分片后,在聊天界面启用知识库上下文,使聊天机器人能够访问PDF内容。确认延迟等指标恢复正常后,再次询问相同问题。 ## 性能与结果 模型现在能识别出“Aurora”用于治疗淀粉样变性心肌病等疾病,并给出了正确答案。这证明了通过池化RAM,用户可以构建一个私有聊天机器人,用自定义知识进行训练,同时所有数据保持本地化。 总之,这种方法允许用户将所有计算设备的RAM集群起来,托管庞大的知识库,实现高效、私有的本地AI应用。 Source: https://youtu.be/H29ASZhpTKQ

相似文章

我如何仅用24GB内存运行193B参数模型

Reddit r/ArtificialInteligence

介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。

内存富裕/显卡贫瘠的人错了吗?

Reddit r/LocalLLaMA

讨论了本地AI中密集模型与混合专家(MoE)模型之间的权衡,指出高内存用户除了Qwen 3.5 122B之外,MoE选择有限,并质疑大显存是否是唯一可行的路径。