标签
作者提出了一种本地优先、分布式的AI智能体模型,用户拥有持久化智能体,可本地运行、与其他智能体协商、跨环境交互,并具备结构化行动和智能体经济。
本文综合了高效分布式LLM服务的研究,将vLLM和llm-d连接为互补层,并提出一个推理执行规划器以用于未来调度器的开发。
Delta 是 Meta 的对象存储服务,通过使用链式复制来实现高可用性和强一致性,专为关键启动和灾难恢复工作负载而设计。
本文探讨了对分布式系统中自稳定组合式理论的探索,批判性分析了近期关于元稳定故障的论文,以及依赖保证契约等形式化方法。
对代理任务队列的分析显示,不同代理的重复认领可能都被验证,但只有一个被计入,导致不可见的浪费以及自报告时间戳的问题和缺乏排除事件。
ByteByteGo团队制作的开源项目system-design-101,通过架构图简化系统设计面试知识点,已获84.1k星标,适合面试准备和团队培训。
作者认为可恢复性是自主AI代理的真正考验,强调了任务持久性和健壮恢复机制的必要性,以确保真正的自主性。
Gorai是一个基于Go的机器人平台,利用NATS.io实现分布式系统,支持服务发现和运行时组合,从而实现AI集成的机器人开发。
这篇博文介绍了如何通过发明一种原生于对象存储的新packfile格式来在对象存储上运行Git,解决了传统Git packfiles在生产规模仓库中的性能问题。
本文提出了一种防泄漏且调度器感知的机器学习框架,用于预测网格作业运行时间,该框架使用CatBoost并结合时间验证,以提高分布式计算环境中的调度效率。
本文回顾了Sprite网络操作系统,在GitHub上提供了其源代码、文档和研究论文,以供历史和教育用途。
PlanetScale在其Neki平台上实现了每秒1.18亿次查询的性能,并在512个分片上实现了线性扩展,展示了卓越的数据库操作性能和吞吐量。
OpenAI详细介绍了Habitat的演变,这个在线存储平台从Python库扩展到每秒处理超过7000万请求的服务,以支持ChatGPT的十亿用户规模。
Neki 是由 PlanetScale 提供的分片式 Postgres 解决方案,可实现水平扩展至数亿 QPS 和 PB 级数据,且操作零停机。
本文讨论了生产环境中自主智能体舰队常见的灾难性故障,强调问题源于分布式系统问题,如模式漂移、未协调的重试和转录处理,而非提示质量。
本文介绍了PlanFence,这是一种依赖作用域的验证协议,通过验证计划与当前公开记录的一致性来防止分布式LLM代理系统中执行过时的计划,并通过受控的实时工作流进行了演示。
本文提供了理解Apache Kafka的结构化学习路径,强调只有在需要解决事件流问题时才应学习。
文章区分了系统设计中的两种抽象类型:模块化抽象,它隐藏内部细节;建模抽象,它将系统简化为基本行为以进行形式化推理。
本文介绍了架构元模式,将软件架构模式概括为适用于本地和分布式系统的更广泛类别,并通过直观图表和陈旧的演示加以说明。