标签
GreptimeDB v1.1 通过单个 ALTER TABLE 语句引入了对现有表的在线重新分区,消除了数据迁移、双写或应用程序变更的需求。它利用共享对象存储和逻辑分片来更新清单和路由,而无需在节点之间移动数据。
本文提出了Epistemic State Replication (ESR),一种面向自主代理分布式系统的信念复制层,它将复制从数据可见性转向知识可见性,使得即使生成模型输出存在差异,也能做出语义上等效的决策。
一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。
作者分享了自己构建原型以验证AI生成的财务声明的经验,重点关注系统与工程挑战,如证据对账和确定性验证,并邀请志同道合的工程师进行交流。
本综述论文考察了Agentic IoT作为下一代认知物联网范式,将自主AI智能体与信息物理系统集成,回顾了其体系结构、应用、挑战和未来方向。
一条推文提出了关于gRPC截止时间传播的问题:如果客户端指定了100毫秒的截止时间,但网络延迟消耗了50毫秒,那么服务器是否仍然拥有完整的100毫秒?
介绍一个从零构建负载均衡器的学习路线,涵盖轮询、最少连接、一致性哈希等算法,以及健康检查间隔等实际陷阱。
DeadPool 为 LLM 训练引入了一种容错机制,能够通过零开销的内存检查点实现故障节点与备用节点的热插拔,在不中断任务的情况下实现快速恢复。
本文解释了如何通过与应用程序数据共置的工作流状态使用Postgres事务,来消除分布式工作流中的幂等性和原子性问题,从而实现精确一次执行。
Miles是RadixArk推出的一个开源的PyTorch原生框架,用于大规模LLM强化学习后训练,集成了SGLang、Megatron-LM和Ray,以实现高吞吐量的推演和分布式训练。
推荐一本开源书《The Accidental CTO》,作者分享了从零到百万用户的架构演进实战经验,涵盖扩展、分布式选型、可观测性等核心内容。
This paper introduces logical physical clocks and methods for consistent snapshots in globally distributed databases, addressing causality and consistency challenges.
Kyle Kingsbury 分享了一份免费的 16-32 小时分布式系统基础课程大纲,涵盖理论、算法和实际生产问题,并通过 Maelstrom 提供可选的实验练习。
@system_monarch的一条推文列出了27个核心系统设计概念(从入门到高级),推荐用于顶级科技公司(如Google、Meta和Uber)的高级软件工程面试。
Silk 是一个为 ClickHouse 设计的新栈式纤程库和调度器,通过 NUMA 感知的工作窃取、io_uring 以及热路径上的零堆分配来提升异步 I/O 性能。它适用于分布式缓存、对象存储和网络 I/O 等 I/O 密集型组件。
本论文来自阿尔托大学,提出了同步架构的分类体系,分析了权衡与决策因素,以指导广义同步引擎的设计。