标签
@venkateshdotdev 的一条推文,列出了10个具有挑战性的系统设计面试题,涵盖URL缩短器、扩展、一致性、限流、容错以及处理流量高峰。
An in-depth technical article explaining the ABD algorithm, quorum replication, and why ABD does not solve consensus, with runnable Python examples.
celld is a self-hosted, distributed server that runs Cloudflare Workers and Durable Objects code unchanged, using your own S3 bucket for storage and coordination. It claims significantly lower costs and sub-millisecond warm latencies at scale, with data stored in SQLite/LTX format.
AWS工程师Zak van der Merwe分享了他14年来为EC2和DSQL构建控制平面的见解,讨论了大规模运行基础设施时面临的分布式系统挑战。
Deno 的 celld 是一个开源守护进程,可在你自己的机器上运行 Cloudflare Workers 和 Durable Objects,每个对象使用 SQLite,并使用兼容 S3 的存储桶进行复制和协调,无需控制平面。
本文提出了智能体操作系统(AOS),这是一个面向分布式智能体系统的厂商中立的参考操作架构,涵盖治理、运行时协调和可靠性。其目标是提供一个稳定的框架,将异构组件组合成可治理、可观测的智能体系统。
Aquaduck,一个崭露头角的推理平台,正在为其多人模型服务网络招募测试人员。该网络可将桌面设备转变为虚拟集群,具备模型分片等功能,并提供一个公共推理网络来利用闲置算力。
文章认为,在最终一致的分布式系统中重试消息会将正常状态误判为故障,并建议改为存储传入数据,待所有前置条件到达后再处理,从而无需重试和死信队列。
一位生产环境工程师描述了多智能体共享内存中的并发写入引发的竞态条件,并解释了如何通过切换到带投影的仅追加事件日志来解决该问题,同时指出了读己之写延迟方面的权衡。
文章详细拆解了 OpenAI 软件工程师的完整面试流程,按轮次分析了初筛、编码、系统设计、居家项目和终面背后的核心考点,并整理成一份可系统的工程师进阶清单。
本教程介绍如何在 Go 和 PostgreSQL 中实现 Outbox 模式,以确保分布式系统中可靠的事件发布,包括构建中继服务和处理至少一次投递。
一篇博客文章解释了为什么单智能体AI框架因令牌成本和单体问题而昂贵,提倡使用专门智能体进行任务委派以及诸如预定义、动态、本地CLI和远程智能体等模式。
来自 Livelymerge 项目的一篇技术说明,演示了 CRDT 收敛(通过 Automerge)并不能保证活程序堆的语义正确合并,并使用了一个链表示例,其中并发交换会导致截断或循环。作者承认了这一问题,并指出了几个有前景的方向。
Antithesis发布了一篇博客文章,详细介绍了在多个开源Raft共识实现(包括HashiCorp Raft和OpenRaft)中发现的Bug,强调了测试分布式系统的困难以及对更好工具的需求。
一本全面的手册,讲解 RPC、Protocol Buffers 和 gRPC,用于构建现代分布式系统,并包含使用 Dart 和 Flutter 的动手实践。
对AI系统中“日志即智能体”这一观点的评论,将应用AI的演进类比为分布式系统时刻。
本文介绍了Phantom,一个借用Linux进程在高效离散事件网络仿真器中运行未经修改的应用程序的工具,展示了相较于Shadow和NS-3等现有工具的显著速度提升。
A tweet praising Raft articles as high-quality gems.
Pulsar Attention 用内容感知的摘要和注意力汇取代了Star Attention中的静态锚点,在长上下文基准测试中将FLOPs降低了3.3倍,同时超越了密集注意力。