@0xCristal: https://x.com/0xCristal/status/2068280221954961731

X AI KOLs Timeline 产品

摘要

本文介绍了一台运行六个AI代理(24/7不间断)的配置,设备是Minisforum MS-S1 Max迷你工作站,搭载AMD Ryzen AI Max+ 395芯片,每月电费仅11美元。文章强调从云端API成本转向本地推理,实现始终在线的代理,用于邮件分类、研究监控和文档处理等任务。

https://t.co/v9jWc1fvwB
查看原文
查看缓存全文

缓存时间: 2026/06/20 16:20

我的桌子底下有一台机器,24/7运行着6个AI代理。每月电费仅需11美元

几个月前,我无法接受让一个AI代理整夜运行。每次循环都要消耗token。每个token都要花钱。所以我得启动任务、盯着它、睡觉前关掉。

现在我有六个代理,在一台烤面包机大小的机器上昼夜不停地运行。它们负责研究、总结、监控、分类和写作——我睡觉时、吃饭时、度假时。电费只涨了11美元。这就是全部运营成本。

直接看要点👇

这就是整套配置、这台机器,以及当AI从你租用的服务变成你拥有的基础设施时,会发生什么变化。

没人谈论的真正宝藏

网上所有人都在争论哪个云端模型更聪明。与此同时,一场悄无声息的硬件革命正在进行,几乎没人注意到。

Minisforum MS-S1 Max 是一台迷你工作站。铝合金机身。可以放在架子上。出厂配备2TB固态硬盘、内置320W电源,以及AMD有史以来最有趣的桌面级芯片:Ryzen AI Max+ 395。

这块芯片的关键在于:它在CPU和GPU之间共享128GB内存。没有独立显卡。没有小容量显存池。只有一个巨大的统一内存池,两个处理器都能读取。这和Apple Silicon在本地AI方面表现出色的架构技巧相同,但这款设备能完美运行Linux,配备双万兆以太网、80Gbps的USB4 V2、一个用于扩展的PCIe x16插槽,价格大约3000美元。

这不是游戏PC。这不是NAS。这是一台本地AI服务器,只是碰巧看起来像台迷你PC。而让它区别于其他所有Strix Halo机型的关键规格是:Minisforum将芯片功耗推到160W,而竞争对手最高只有120-140W。更高的功耗意味着持续推理时速度更快。当你的代理运行数小时时,这点至关重要。

它能运行什么以及速度如何

在Linux上安装Ollama。拉取一个模型。就这么简单。没有驱动问题,没有CUDA依赖链,没有配置文件。以下是这台机器在使用Q4量化模型时的实际表现:

30B和70B模型是主力。交互使用足够快。235B模型在许多基准测试中与Claude Sonnet处于同一水平,速度稍慢,但你不需要为每个token付费,所以可以让它慢慢思考。

这里有个绝活:Minisforum设计了这款机器用于集群。两台MS-S1 Max连接在一起可以以约11 token/秒的速度运行Qwen3-235B。四台设备可以运行DeepSeek-R1 671B(完整380GB模型)。本地运行。在桌子上。没有数据中心。没有云端。

为什么“始终在线“能改变一切

这是人们对本地AI理解不足的地方。并不是说模型能和GPT-5或Claude Opus一样好。关键是当推理变得免费时,你的行为会发生什么变化。

当你为每个token付费时,你在输入提示前会反复思考。你会优化查询。你会提前终止实验。你永远不会让一个代理循环运行八小时,因为这笔账算不过来。

当推理只消耗电费而别无其他时,你就不再那么想了。而真正的价值就在这里体现。

我昼夜运行的六个代理:

  • 收件箱整理器。 每15分钟拉取一次我的邮件。对所有邮件进行分类。为常规邮件草拟回复。我早上醒来时,收件箱已整理好,草稿回复也准备好了。每天节省时间:大约40分钟。

  • 研究监控器。 监控30多个RSS源、特定小众论坛和跨平台的特定账号。将与我的工作相关的所有内容总结成每日摘要,早上7点发送到Telegram。如果使用云API,这每天需要花费15-20美元的token费用。在这台机器上:免费。

  • 文档处理器。 我放入指定文件夹的任何内容,都会被读取、总结和打标签。合同、报告、PDF、研究论文。几分钟内,总结和关键点就会出现在我的笔记应用中。我已经好几个月没有手动阅读过40页的报告了。

  • 代码审查员。 监控我的Git仓库。每次推送都会触发审查:代码风格、错误、安全性、测试覆盖率。结果以评论形式发布。运行70B模型,所以审查效果确实不错。

  • 会议准备代理。 查看明天的日历,从我的笔记和近期邮件中提取关于每个人/主题的上下文,为每次会议生成一份一页的简报。早上8点准备就绪。

  • 学习代理。 接收我感兴趣的话题,查找最新的论文和文章,夜间使用235B模型阅读,每周产出一份“新动态“报告,用我能理解的水平进行解释。

单独来看,这些功能都没有革命性。革命性在于同时运行全部六个、全天候不停歇,而且不在意成本。如果使用云API,这套组合每月大约需要800-1200美元。在MS-S1 Max上,它只体现在电费账单上。

搭建过程。一个晚上,大部分时间在下载

1. 用Linux替换Windows

机器出厂预装Windows 11,限制GPU可访问内存约96GB。Ubuntu 24.04可以解锁完整内存池。从USB启动,格式化,安装。20分钟。

2. 安装Ollama

3. 拉取你需要的模型

4. 设置Open WebUI(可选,提供类似ChatGPT的界面)

现在网络上的任何设备——手机、笔记本、平板——都可以通过http://your-box:3000与你的模型对话。

5. 将Claude Code指向本地端点

使用相同的Claude Code CLI。相同的代理循环。每个请求都发往你的机器,而不是Anthropic。没有任何数据离开你的网络。

6. 构建你的代理

这是最有趣的部分,也是因人而异的部分。我混合使用了简单的cron脚本、n8n工作流和Claude Code的代理模式来处理更复杂的任务。模型是引擎。如何连接它们取决于你。

总搭建时间:如果你从未接触过Linux,大约90分钟。如果你熟悉,大约一小时。

算笔账。很重要!

盈亏平衡之后,每个月省下的钱都留在你账户里。三年下来,根据你使用代理的程度,可以节省25,000到40,000美元,这些钱本会付给AI公司。

但说实话,节省不是重点。重点是行为改变。当每个token都要花钱时,我开始构建那些我本来永远不会构建的代理。会议准备代理?原来绝不可能为了“有更好“的功能去证明API成本的合理性。用235B模型整夜运行在看论文上的学习代理?按token算简直荒谬。但免费时就显而易见了。

这台机器做不到的事

我不会假装本地能完全取代云端。不能。以下是目前的分界线:

仍然需要云端的场景:

  • 前沿推理(Claude Opus、GPT-5,用于真正困难的5%问题)

  • 模型内置的实时网络访问和工具使用

  • 云端模型领先好几代的多模态任务

  • 为5人以上的团队同时提供服务

这台机器处理其余所有事情:

  • 日常编码和脚本编写

  • 文档分析和总结

  • 长时间运行的代理和后台自动化

  • 私有数据处理(数据不离开你的网络)

  • 起草、编辑、头脑风暴

  • 基于个人知识库的RAG

  • 批量处理(转录、分类、提取)

对于云端任务,你通过API按使用量付费。这里5美元,那里10美元。而不是每月200美元的订阅费,却只用其中的20%。

诚实的缺点

机器在负载下会发热。并不危险,但风扇声音可闻。不要放在卧室。通风的壁橱可以。桌子下面也行。

开源模型不是Claude Opus。它们在许多任务上很接近,但在最难的推理问题上明显落后。如果你的工作100%是前沿难度的AI任务,这台机器不适合你。如果你的工作80%是常规任务,20%是难题,那就在本地运行80%,按使用量付费解决20%。

你在购买硬件。如果AMD明年推出速度快一倍的产品,你的3000美元不会自动回本。但3-4个月的盈亏平衡点意味着你不需要用五年。即使只用一年,这笔账也算得过来。

AMD上的Ollama现在很稳定,但还没有达到CUDA级别的成熟度。偶尔会有新模型首发仅支持Nvidia优化。你需要等一两周。这是早期采用者的代价。

而且你需要能接受Linux。上面的命令很简单。但第一次出问题时,你可能会在论坛上花一个小时。这是现在选择本地化而不是再等一年的代价。

为什么选这款特定机型

市面上有十几款Strix Halo迷你PC。MS-S1 Max因以下三点脱颖而出:

160W持续功耗。 超过任何竞争对手。大型模型的推理速度随功耗提升。当代理运行数小时时,这一点至关重要。

双万兆网口。 大多数竞争对手只有2.5GbE。如果你需要传输大文件、将多个设备集群、或将其作为网络AI服务器运行,万兆网络会带来完全不同的体验。

可安装在2U机架中。 这个细节听起来小众,但如果你知道这意味着可以在标准机架中堆叠两台或四台,构建一个能运行671B参数模型的本地AI集群,那么它就不那么小众了。放在你桌上。价格相当于一辆二手车。

真正的重点

AI行业希望你认为智能是一种公用事业。需要订阅的东西。按用量计费。活在别人数据中心里的东西。按别人的时间表运行。你停止付费就停止运行。

这个模式在硬件跟不上时代时说得通。现在不再如此。

128GB统一内存。专为AI推理设计的芯片。覆盖你80%需求的开源模型。一小时内就能安装完成的开源软件栈。

一台机器。放在你桌子底下。运行着六个永不休息的代理。

一次投入3000美元。每月11美元电费。所有数据留在你的网络内。

这就是整套方案。我只后悔没有早点开始。

想要更多内幕消息?

关注我,趁还能加入时加入我的私密频道:链接

相似文章

@mronge: https://x.com/mronge/status/2052846432969720202

X AI KOLs Timeline

一份在 Mac mini 上搭建全天候 AI 代理的实用指南,涵盖硬件选型、云端与本地 AI 模型的权衡取舍,以及用于自动化销售报告、社交媒体建议等任务的代理系统选择。