@0xCristal: https://x.com/0xCristal/status/2068280221954961731
摘要
本文介绍了一台运行六个AI代理(24/7不间断)的配置,设备是Minisforum MS-S1 Max迷你工作站,搭载AMD Ryzen AI Max+ 395芯片,每月电费仅11美元。文章强调从云端API成本转向本地推理,实现始终在线的代理,用于邮件分类、研究监控和文档处理等任务。
查看缓存全文
缓存时间: 2026/06/20 16:20
我的桌子底下有一台机器,24/7运行着6个AI代理。每月电费仅需11美元
几个月前,我无法接受让一个AI代理整夜运行。每次循环都要消耗token。每个token都要花钱。所以我得启动任务、盯着它、睡觉前关掉。
现在我有六个代理,在一台烤面包机大小的机器上昼夜不停地运行。它们负责研究、总结、监控、分类和写作——我睡觉时、吃饭时、度假时。电费只涨了11美元。这就是全部运营成本。
直接看要点👇
这就是整套配置、这台机器,以及当AI从你租用的服务变成你拥有的基础设施时,会发生什么变化。
没人谈论的真正宝藏
网上所有人都在争论哪个云端模型更聪明。与此同时,一场悄无声息的硬件革命正在进行,几乎没人注意到。
Minisforum MS-S1 Max 是一台迷你工作站。铝合金机身。可以放在架子上。出厂配备2TB固态硬盘、内置320W电源,以及AMD有史以来最有趣的桌面级芯片:Ryzen AI Max+ 395。
这块芯片的关键在于:它在CPU和GPU之间共享128GB内存。没有独立显卡。没有小容量显存池。只有一个巨大的统一内存池,两个处理器都能读取。这和Apple Silicon在本地AI方面表现出色的架构技巧相同,但这款设备能完美运行Linux,配备双万兆以太网、80Gbps的USB4 V2、一个用于扩展的PCIe x16插槽,价格大约3000美元。
这不是游戏PC。这不是NAS。这是一台本地AI服务器,只是碰巧看起来像台迷你PC。而让它区别于其他所有Strix Halo机型的关键规格是:Minisforum将芯片功耗推到160W,而竞争对手最高只有120-140W。更高的功耗意味着持续推理时速度更快。当你的代理运行数小时时,这点至关重要。
它能运行什么以及速度如何
在Linux上安装Ollama。拉取一个模型。就这么简单。没有驱动问题,没有CUDA依赖链,没有配置文件。以下是这台机器在使用Q4量化模型时的实际表现:
30B和70B模型是主力。交互使用足够快。235B模型在许多基准测试中与Claude Sonnet处于同一水平,速度稍慢,但你不需要为每个token付费,所以可以让它慢慢思考。
这里有个绝活:Minisforum设计了这款机器用于集群。两台MS-S1 Max连接在一起可以以约11 token/秒的速度运行Qwen3-235B。四台设备可以运行DeepSeek-R1 671B(完整380GB模型)。本地运行。在桌子上。没有数据中心。没有云端。
为什么“始终在线“能改变一切
这是人们对本地AI理解不足的地方。并不是说模型能和GPT-5或Claude Opus一样好。关键是当推理变得免费时,你的行为会发生什么变化。
当你为每个token付费时,你在输入提示前会反复思考。你会优化查询。你会提前终止实验。你永远不会让一个代理循环运行八小时,因为这笔账算不过来。
当推理只消耗电费而别无其他时,你就不再那么想了。而真正的价值就在这里体现。
我昼夜运行的六个代理:
-
收件箱整理器。 每15分钟拉取一次我的邮件。对所有邮件进行分类。为常规邮件草拟回复。我早上醒来时,收件箱已整理好,草稿回复也准备好了。每天节省时间:大约40分钟。
-
研究监控器。 监控30多个RSS源、特定小众论坛和跨平台的特定账号。将与我的工作相关的所有内容总结成每日摘要,早上7点发送到Telegram。如果使用云API,这每天需要花费15-20美元的token费用。在这台机器上:免费。
-
文档处理器。 我放入指定文件夹的任何内容,都会被读取、总结和打标签。合同、报告、PDF、研究论文。几分钟内,总结和关键点就会出现在我的笔记应用中。我已经好几个月没有手动阅读过40页的报告了。
-
代码审查员。 监控我的Git仓库。每次推送都会触发审查:代码风格、错误、安全性、测试覆盖率。结果以评论形式发布。运行70B模型,所以审查效果确实不错。
-
会议准备代理。 查看明天的日历,从我的笔记和近期邮件中提取关于每个人/主题的上下文,为每次会议生成一份一页的简报。早上8点准备就绪。
-
学习代理。 接收我感兴趣的话题,查找最新的论文和文章,夜间使用235B模型阅读,每周产出一份“新动态“报告,用我能理解的水平进行解释。
单独来看,这些功能都没有革命性。革命性在于同时运行全部六个、全天候不停歇,而且不在意成本。如果使用云API,这套组合每月大约需要800-1200美元。在MS-S1 Max上,它只体现在电费账单上。
搭建过程。一个晚上,大部分时间在下载
1. 用Linux替换Windows
机器出厂预装Windows 11,限制GPU可访问内存约96GB。Ubuntu 24.04可以解锁完整内存池。从USB启动,格式化,安装。20分钟。
2. 安装Ollama
3. 拉取你需要的模型
4. 设置Open WebUI(可选,提供类似ChatGPT的界面)
现在网络上的任何设备——手机、笔记本、平板——都可以通过http://your-box:3000与你的模型对话。
5. 将Claude Code指向本地端点
使用相同的Claude Code CLI。相同的代理循环。每个请求都发往你的机器,而不是Anthropic。没有任何数据离开你的网络。
6. 构建你的代理
这是最有趣的部分,也是因人而异的部分。我混合使用了简单的cron脚本、n8n工作流和Claude Code的代理模式来处理更复杂的任务。模型是引擎。如何连接它们取决于你。
总搭建时间:如果你从未接触过Linux,大约90分钟。如果你熟悉,大约一小时。
算笔账。很重要!
盈亏平衡之后,每个月省下的钱都留在你账户里。三年下来,根据你使用代理的程度,可以节省25,000到40,000美元,这些钱本会付给AI公司。
但说实话,节省不是重点。重点是行为改变。当每个token都要花钱时,我开始构建那些我本来永远不会构建的代理。会议准备代理?原来绝不可能为了“有更好“的功能去证明API成本的合理性。用235B模型整夜运行在看论文上的学习代理?按token算简直荒谬。但免费时就显而易见了。
这台机器做不到的事
我不会假装本地能完全取代云端。不能。以下是目前的分界线:
仍然需要云端的场景:
-
前沿推理(Claude Opus、GPT-5,用于真正困难的5%问题)
-
模型内置的实时网络访问和工具使用
-
云端模型领先好几代的多模态任务
-
为5人以上的团队同时提供服务
这台机器处理其余所有事情:
-
日常编码和脚本编写
-
文档分析和总结
-
长时间运行的代理和后台自动化
-
私有数据处理(数据不离开你的网络)
-
起草、编辑、头脑风暴
-
基于个人知识库的RAG
-
批量处理(转录、分类、提取)
对于云端任务,你通过API按使用量付费。这里5美元,那里10美元。而不是每月200美元的订阅费,却只用其中的20%。
诚实的缺点
机器在负载下会发热。并不危险,但风扇声音可闻。不要放在卧室。通风的壁橱可以。桌子下面也行。
开源模型不是Claude Opus。它们在许多任务上很接近,但在最难的推理问题上明显落后。如果你的工作100%是前沿难度的AI任务,这台机器不适合你。如果你的工作80%是常规任务,20%是难题,那就在本地运行80%,按使用量付费解决20%。
你在购买硬件。如果AMD明年推出速度快一倍的产品,你的3000美元不会自动回本。但3-4个月的盈亏平衡点意味着你不需要用五年。即使只用一年,这笔账也算得过来。
AMD上的Ollama现在很稳定,但还没有达到CUDA级别的成熟度。偶尔会有新模型首发仅支持Nvidia优化。你需要等一两周。这是早期采用者的代价。
而且你需要能接受Linux。上面的命令很简单。但第一次出问题时,你可能会在论坛上花一个小时。这是现在选择本地化而不是再等一年的代价。
为什么选这款特定机型
市面上有十几款Strix Halo迷你PC。MS-S1 Max因以下三点脱颖而出:
160W持续功耗。 超过任何竞争对手。大型模型的推理速度随功耗提升。当代理运行数小时时,这一点至关重要。
双万兆网口。 大多数竞争对手只有2.5GbE。如果你需要传输大文件、将多个设备集群、或将其作为网络AI服务器运行,万兆网络会带来完全不同的体验。
可安装在2U机架中。 这个细节听起来小众,但如果你知道这意味着可以在标准机架中堆叠两台或四台,构建一个能运行671B参数模型的本地AI集群,那么它就不那么小众了。放在你桌上。价格相当于一辆二手车。
真正的重点
AI行业希望你认为智能是一种公用事业。需要订阅的东西。按用量计费。活在别人数据中心里的东西。按别人的时间表运行。你停止付费就停止运行。
这个模式在硬件跟不上时代时说得通。现在不再如此。
128GB统一内存。专为AI推理设计的芯片。覆盖你80%需求的开源模型。一小时内就能安装完成的开源软件栈。
一台机器。放在你桌子底下。运行着六个永不休息的代理。
一次投入3000美元。每月11美元电费。所有数据留在你的网络内。
这就是整套方案。我只后悔没有早点开始。
想要更多内幕消息?
关注我,趁还能加入时加入我的私密频道:链接
相似文章
@mr_r0b0t: 16个本地AI代理同时流式传输!MiniMax M2.7 NVFP4 — 2x GB10,没有云API。
演示展示了使用MiniMax M2.7 NVFP4在两个Nvidia GB10芯片上同时流式传输16个本地AI代理,无需云API。
@mronge: https://x.com/mronge/status/2052846432969720202
一份在 Mac mini 上搭建全天候 AI 代理的实用指南,涵盖硬件选型、云端与本地 AI 模型的权衡取舍,以及用于自动化销售报告、社交媒体建议等任务的代理系统选择。
@DeRonin_: 我目前的本机AI配置:- 2x DGX Spark 链接 (256gb) > GLM 5.2 @ 2bit, 推理 + 代理循环 - Mac Studio M3 Ultr…
一位用户描述了他们完全本地的AI堆栈,使用多个硬件设备运行GLM、Qwen和Kimi等中国模型,声称相比GPT-5.5和Opus 4.8等前沿模型节省了87%的成本,同时提到了自托管视频生成的计划。
AMD的小型AI PC预示着模型推理向本地化未来的转变
AMD的Ryzen AI Max平台配备128GB统一内存,可本地推理高达2000亿参数的大模型,旨在将AI工作负载从云端转移到紧凑的个人硬件上。
@DivyanshT91162: 每个人都被云端的AI代理分心……与此同时,一些人悄悄地把他们的笔记本电脑变成了自主AI…
描述如何将笔记本电脑变成一台24/7全天候自主AI研究机器,使用 Qwen3-35B-A3B、llama.cpp 和 Unsloth 的4位量化,无需云或GPU服务器。