我停止打造一家AI优先的公司。正确的Hermes设置应该是什么样子

Reddit r/AI_Agents 新闻

摘要

作者分享了从二元(AI能或不能)方法转向三层体系(手动、带审查的自主、全自主)来构建AI代理的经验,使用Hermes搭配DeepSeek V4 Flash作为编排器,Claude Code作为执行器,并引入看板板和确定性脚本以确保可靠性。

我对“零员工的自主AI公司”这种炒作感到筋疲力尽,退出了两个月,回来后意识到我真正的错误在于以二元方式思考任务——*AI能还是不能做*。突破口是一个**中间层级**:AI大部分时间能做好的任务,但风险足够高,需要一个审查关卡。我现在将Hermes作为一个廉价的编排器(DeepSeek V4 Flash),将所有实际工作委托给Claude Code作为执行器,两者之间有一个看板。将LLM调用包裹在确定性脚本中解决了“哦,我忘记更新状态”的问题。我使用了Openclaw大约两个月,直到Anthropic在4月份限制将其订阅用于代理。然后我又退出了两个月,主要是为了远离噪音。互联网的每个角落都有人在承诺全自动的内容/金钱工厂。即使是聪明、懂技术的人也上当了。当我回来时,我发现了我的实际错误。我一直把所有任务分成两个桶:**AI能做什么**和**AI不能做什么**。在这种模式下,你不断发现代理不可靠的情况,最终只能亲自监督——此时它并不比直接在笔记本电脑上使用Claude好。我忽略的是一个完整的中间类别。 于是我转向了一个**三层体系**: * **第一层——纯手动。** 个人事务我亲手做。但我仍然告诉代理要主动(例如,“帮我起草那封邮件”,即便我会发送)。 * **第二层——带审查关卡的自主。** 主要是编码。代理构建功能,推送到预览分支,发送报告+链接给我。我审查、批准,然后它发布。这是我之前忽略的层级,也是价值所在。 * **第三层——全自主。** 定时/周期性任务:每周SEO修复、安全审查、各应用的可用性测试。端到端运行,我只需看报告。只有在真正考虑了风险之后,才把任务放在这里。 **让其可行的设置:** * 托管在廉价的VPS上(Hetzner,4核/8GB,约10美元/月——足以应对99%的情况)。 * Hermes作为**编排器**,以DeepSeek V4 Flash作为其大脑。便宜、快速、出奇地聪明。它的工作是交谈、规划和*委派*——从不直接接触文件/代码/配置。 * **Claude Code作为执行器。** 所有实际工作(后端、前端、数据库、安全、测试、部署)都通过我一年多来构建的安全护栏运行。委托给它让我可以使用现有的Max订阅限额,而不是烧API费用。 * 两者之间有一个内置的**看板**,因此每个任务、评论和决策都会被记录,我可以像观察同事一样观察代理工作。 **一个值得借鉴的非明显修复:** 当你的工作流存在于`.md`技能文件中时,顶级模型*大多*会遵循它们,但偶尔会“忘记”某个步骤(“哦,你说得对,我忘了”)。修复方法是将LLM执行包裹在一个确定性脚本中(Python/JS/等),这样重要的事情——比如在LLM运行*之前*创建看板卡片——被硬编码且无法跳过。围绕非确定性核心构建确定性脚手架。 解决一切问题的思维转变:**不要再让模型替你想,而是使用足够聪明可以委派任务的最便宜模型。**
查看原文

相似文章