它起初是一个GitHub个人资料生成器。然后意外地交易了股票。现在它是一个AI代理平台。

Reddit r/AI_Agents 产品

摘要

Magine从一个简单的GitHub个人资料生成器演变为一个AI代理平台,具备视觉驱动代理和分布式GPU网格,包括增长指标和代理编排的技术创新。

是的,你没看错:一个GitHub个人资料生成器意外地交易了股票,开始交易后变成了代理编排平台。现在我们正试图让编码代理进行测量而不是猜测。七个月前,我构建了一个小工具来生成GitHub个人资料卡(只为我自己)。仅此而已。一个周末项目。在该仓库的某个私有分支中,我添加了一个代理编排功能。不是为了别人。我希望有一个能在我睡觉时监视ETFs并自行交易的东西,并按照我写下的规则执行。它出错了。我修补了它。它又出错了。经过几轮后,它的表现超出了我的预期,并在那个月产生了巨额利润,足以让我停止将其视为玩具。但我没有的是一个能观察它在做什么的方法。我看到的每个'代理构建器'都是一样的:一个聊天框、一个侧边栏、数百个MCPs集成器、连接数十个API、一个副本的副本。我不想再构建另一个这样的东西,也不想使用它。所以我构建了相反的东西。一个单页面。一个复古终端。与其盲目使用Playwright,我决定采用基于视觉的方法,我们称之为视觉驱动代理(SDAs)。你输入,代理运行,你就像一个孩子在书桌前一样在实时沙盒中观看它们工作。没有需要点击的仪表板,没有MCPs,没有连接器(OpenClaw黑子),它按照你的指示行动。今天它看起来仍然如此,并将保持这样。这就是Magine 😺的起源。以下是它现在的状况,以及我真正想谈论的部分:为什么我们放弃了我们的编码代理。我们的现状是每月经常性收入1.2千美元(很低,部分是有意为之:我们给了我们心爱的早期用户很多免费额度😽),月环比增长约19%,零营销支出,零广告。每个用户都来自直接邀请或测试邀请。平台上有超过5,000小时的自主代理运行时间,从代理在真实浏览器中工作捕获了超过700万浏览器帧,峰值时超过1,000个并发浏览器容器。团队从两人增长到四人。我仍然是唯一的技术人员,我辞去了CTO的工作,只为了维持生计而找了一份日常工作。这意味着我几乎没有时间平衡核心开发与我们现在急需的增长会议。同时,我的收件箱里有数十封来自VCs对我们MRR——抱歉,我们的**产品**——感兴趣的邮件,而我们进行随意的介绍聊天。我们大约40%的支出用于GPU。我们给每个新用户提供100万令牌进行测试。如果您已经熟悉其他平台,这听起来可能不多,但由于我们积极缓存上下文并压缩输入和输出,这些令牌的使用效率远高于原始数字所示。有两件事我暗自感到自豪。首先,Magine具有三重冗余执行:如果视觉失败(怪GPU可用性),它默认使用CDP;如果CDP失败,它利用经典的devtools和VLMs结合帧,借鉴Anthropic和Manus的方法。此外,我们的路线图确保Magine将完全离线使用边缘LLM运行。其次,所有繁重的任务都运行在我们从平台本身注册的GPU工作机器网格上:LLM推理、浏览器代理的视觉推理、模型训练以及CatCode用来测量代码的沙盒。工作被路由到任何有GPU、RAM和余量的节点,推理在节点之间故障转移,沙盒获得自己的隔离槽位,而不是与模型争夺同一张卡。上面提到的1,000多个并发浏览器容器就是在该网格上运行的。我们这个月放弃了传统的编码代理。我们有过一个。打开项目,启动沙盒,告诉代理构建什么。它有效。但它也完全不有趣,因为其他十种产品做完全相同的事情,而且没有一个回答当代理编辑你的代码时真正重要的问题:它变得更好了,还是只是看起来不同了?一个说'我优化了你的函数'的代理给你的是一个意见。没有人应该发布一个意见。所以我们重建了这个东西,我们称之为CatCode。表面上,它是这样工作的:你给它一句话。'让src/match.py中的匹配器更快,而不改变其输出。'没有配置,没有标记,没有设置。它选择值得更改的代码,并在执行任何操作前要求你确认。你可以说是、否或用自己的话重新定向它。它遵循你的话而不是它自己的计划。它编写自己的评估器,然后通过故意提供损坏的代码版本来测试评估器。如果评判者无法区分损坏和正确的代码,运行就会停止。它不会优化毫无意义的数字。它从几个不同的角度生成竞争想法,在编写任何代码前对它们进行评分,将最好的转化为候选,通过廉价筛选竞争它们,并且只全面测量幸存者。在你自己的沙盒中。它多次测量你的原始代码以了解噪声,重新测量赢家,只有在通过两个独立统计测试的噪声时才称之为成功。它在你的仓库中写入一个DISCOVERY.md文件:基线运行、确认运行、确切的差异、运行时间如何随输入大小扩展以及威胁有效性的部分。该文件中的每个数字都是测量的,而不是估计的。它也从不自行配置或调整基础设施。如果你的沙盒太小,它会告诉你任务所需的确切大小和获取它的命令。你的机器仍然是你的。这是AlphaEvolve家族的理念(提议、测量、保留赢家)指向你的代码,有一个在被信任前被审计的评判者和一个行动前先询问的代理。这就是方向。我们并不是声称我们已经打败了任何人的数字。研究方面:除了编排部分,我们一直在研究一个受JEPA启发的架构,我们称之为RD-S4/EFR,试图构建一个无注意力、线性复杂度的模型,在运行时适应其内部路径。现在还处于早期阶段。我们正在准备一篇论文,并在结果站得住脚时分享,而不是之前。接下来是什么:使用基于视觉的工作流程生成视频,在平台内跟踪对象和主体;在CatCode离开实验状态后开源Magine。它仍然是实验性的。我们仍在得出关于其性能如何的结论,我们宁愿诚实地向你展示,而不是过早。一个营销工作流程,因为现在还没有,你看到的以上增长完全是口碑。我真正希望读者提供建议的地方:有两个决定我反复犹豫不决,我宁愿从已经发布过的人那里听取而不是猜测:视频生成。我们已经尝试构建过一个类似电影的工作流程:摄像机角度、镜头方向、分类画面中的对象和主体,以便代理可以跨场景跟踪它们。它失败了。不是'需要完善'的失败,而是彻底失败。我们即将用运行我们浏览器代理的视觉方法再次尝试,老实说我不知道这是坚持还是固执。如果你在视频生成或对象跟踪方面构建过任何东西,请告诉我我们将面临什么。范围。我们周围的每个平台都在将所有内容压缩成一个产品,我们也在做同样的事情。另一种选择是放弃它,将整个团队放在真正属于我们的两件事上:模型研究和基于视觉的浏览器自动化。'一个平台包含一切'对于一个只有一名工程师的四人团队来说是正确的选择,还是小想法死亡的方式?我宁愿要诚实的答案而不是礼貌的答案。如果你读到了这里:感谢你阅读这段旅程😊。我希望你们每个人都成为其中的一部分,我将继续发布我们交付的内容,包括那些不工作的部分。
查看原文

相似文章