distributed-systems

标签

Cards List
#distributed-systems

@Greptime: 重新分区大表通常是一个迁移项目:新建表、双写、回填TB级历史数据、切换。Gr…

X AI KOLs Timeline ↗ · 2026-07-14 缓存

GreptimeDB v1.1 通过单个 ALTER TABLE 语句引入了对现有表的在线重新分区,消除了数据迁移、双写或应用程序变更的需求。它利用共享对象存储和逻辑分片来更新清单和路由,而无需在节点之间移动数据。

0 人收藏 0 人点赞
#distributed-systems

复制信念,而非比特:面向自主代理系统的Epistemic State Replication

arXiv cs.AI ↗ · 2026-07-14 缓存

本文提出了Epistemic State Replication (ESR),一种面向自主代理分布式系统的信念复制层,它将复制从数据可见性转向知识可见性,使得即使生成模型输出存在差异,也能做出语义上等效的决策。

0 人收藏 0 人点赞
#distributed-systems

精确一次执行并不存在,代理栈需要接受这一事实

Reddit r/AI_Agents ↗ · 2026-07-13

本文认为,在分布式系统中实现精确一次执行是不可能的,并且必须设计代理栈来应对这一限制。

0 人收藏 0 人点赞
#distributed-systems

Paxos 简明 (2001)[pdf]

Hacker News Top ↗ · 2026-07-09

本文简明地解释了 Paxos 算法,该算法用于在分布式系统中达成共识。

0 人收藏 0 人点赞
#distributed-systems

我的AI对我撒谎的那天,以及我为何对此感到高兴

Reddit r/AI_Agents ↗ · 2026-07-09

一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。

0 人收藏 0 人点赞
#distributed-systems

标题:我正在寻找喜欢解决正确性而非AI问题的工程师

Reddit r/artificial ↗ · 2026-07-08

作者分享了自己构建原型以验证AI生成的财务声明的经验,重点关注系统与工程挑战,如证据对账和确定性验证,并邀请志同道合的工程师进行交流。

0 人收藏 0 人点赞
#distributed-systems

Agentic IoT:体系结构、应用及迈向Internet of Agents的挑战

arXiv cs.AI ↗ · 2026-07-07 缓存

本综述论文考察了Agentic IoT作为下一代认知物联网范式,将自主AI智能体与信息物理系统集成,回顾了其体系结构、应用、挑战和未来方向。

0 人收藏 0 人点赞
#distributed-systems

@msimoni: 关于gRPC截止时间:如果客户端说“我愿意等待100毫秒”,但请求在网络传输上花费了50毫秒……

X AI KOLs Timeline ↗ · 2026-07-06

一条推文提出了关于gRPC截止时间传播的问题:如果客户端指定了100毫秒的截止时间,但网络延迟消耗了50毫秒,那么服务器是否仍然拥有完整的100毫秒?

0 人收藏 0 人点赞
#distributed-systems

恢复中的亚稳态:带有循环的级联恢复

Lobsters Hottest ↗ · 2026-07-06 缓存

讨论了级联恢复和反馈循环如何在分布式系统中导致亚稳态故障,阻止正常恢复。

0 人收藏 0 人点赞
#distributed-systems

@chessMan786: 负载均衡器:从零构建分布式系统 轮询、最少连接、一致性哈希及其他……

X AI KOLs Timeline ↗ · 2026-07-03 缓存

介绍一个从零构建负载均衡器的学习路线,涵盖轮询、最少连接、一致性哈希等算法,以及健康检查间隔等实际陷阱。

0 人收藏 0 人点赞
#distributed-systems

DeadPool:通过零开销检查点实现热插拔的弹性LLM训练

arXiv cs.LG ↗ · 2026-07-03 缓存

DeadPool 为 LLM 训练引入了一种容错机制,能够通过零开销的内存检查点实现故障节点与备用节点的热插拔,在不中断任务的情况下实现快速恢复。

0 人收藏 0 人点赞
#distributed-systems

Postgres事务是分布式系统的超能力

Hacker News Top ↗ · 2026-07-02 缓存

本文解释了如何通过与应用程序数据共置的工作流状态使用Postgres事务,来消除分布式工作流中的幂等性和原子性问题,从而实现精确一次执行。

0 人收藏 0 人点赞
#distributed-systems

Miles:用于大规模LLM强化学习后训练的PyTorch原生栈(14分钟阅读)

TLDR AI ↗ · 2026-07-01 缓存

Miles是RadixArk推出的一个开源的PyTorch原生框架,用于大规模LLM强化学习后训练,集成了SGLang、Megatron-LM和Ray,以实现高吞吐量的推演和分布式训练。

0 人收藏 0 人点赞
#distributed-systems

@Jolyne_AI: 最近在 GitHub 偶遇一本很不错的开源书:The Accidental CTO,忍不住想分享给大家。 作者不是科班出身,却一路把一个平台从零带到能扛住百万用户访问。书里讲的不是“最佳实践”的样板答案,而是踩坑、救火、复盘之后沉淀下来的…

X AI KOLs Timeline ↗ · 2026-06-30 缓存

推荐一本开源书《The Accidental CTO》,作者分享了从零到百万用户的架构演进实战经验,涵盖扩展、分布式选型、可观测性等核心内容。

0 人收藏 0 人点赞
#distributed-systems

在故障处修复:局部故障恢复的论证

Reddit r/openclaw ↗ · 2026-06-27

本文主张在分布式系统中采用局部故障恢复机制,强调在组件级别修复故障而非依赖全局恢复的好处。

0 人收藏 0 人点赞
#distributed-systems

Logical Physical Clocks and Consistent Snapshots in Globally Distributed DB [pdf]

Hacker News Top ↗ · 2026-06-27 缓存

This paper introduces logical physical clocks and methods for consistent snapshots in globally distributed databases, addressing causality and consistency challenges.

0 人收藏 0 人点赞
#distributed-systems

@vivekgalatage: Kyle Kingsbury 的分布式系统导论 https://github.com/aphyr/distsys-class…

X AI KOLs Timeline ↗ · 2026-06-27 缓存

Kyle Kingsbury 分享了一份免费的 16-32 小时分布式系统基础课程大纲,涵盖理论、算法和实际生产问题,并通过 Maelstrom 提供可选的实验练习。

0 人收藏 0 人点赞
#distributed-systems

@system_monarch: 假设你已安排了这些70LPA-1Cr+ CTC的面试:Google L5 / Meta E5 / Uber Staff / Amazon L6 / Sa…

X AI KOLs Timeline ↗ · 2026-06-26 缓存

@system_monarch的一条推文列出了27个核心系统设计概念(从入门到高级),推荐用于顶级科技公司(如Google、Meta和Uber)的高级软件工程面试。

0 人收藏 0 人点赞
#distributed-systems

宣布 Silk:为 ClickHouse 打造的丝滑纤程运行时

Lobsters Hottest ↗ · 2026-06-25 缓存

Silk 是一个为 ClickHouse 设计的新栈式纤程库和调度器,通过 NUMA 感知的工作窃取、io_uring 以及热路径上的零堆分配来提升异步 I/O 性能。它适用于分布式缓存、对象存储和网络 I/O 等 I/O 密集型组件。

0 人收藏 0 人点赞
#distributed-systems

广义同步的局限:架构、权衡与决策因素的分类体系

Lobsters Hottest ↗ · 2026-06-25 缓存

本论文来自阿尔托大学,提出了同步架构的分类体系,分析了权衡与决策因素,以指导广义同步引擎的设计。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈