distributed-systems

标签

Cards List
#distributed-systems

AI代理失败本质上是分布式系统失败

Reddit r/AI_Agents · 2026-07-20

本文认为,AI代理系统中的失败可以通过分布式系统的视角来理解,并将代理行为与经典的分布式系统问题进行类比。

0 人收藏 0 人点赞
#distributed-systems

联邦可解释人工智能:角色、架构、评估与开放挑战

arXiv cs.LG · 2026-07-16 缓存

对联邦可解释人工智能(FedXAI)的系统性综述,涵盖角色、架构、评估实践和开放挑战。提出了一个多轴分类法,讨论了从模型无关到可解释性设计的方法,强调了标准化和隐私感知评估方面的空白。

0 人收藏 0 人点赞
#distributed-systems

比较 Obelisk、Temporal 和 Restate

Lobsters Hottest · 2026-07-15 缓存

对三个工作流系统(Obelisk、Temporal、Restate)实现天气预报工作流的技术比较,重点突出架构、Rust API、确定性边界和部署模型等方面的差异。

0 人收藏 0 人点赞
#distributed-systems

@yoheinakajima:“这篇论文的见解指向一个更大的模式:AI智能体本质上是包含不可靠组件(LLM)的分布式系统,我们应该将分布式系统的模式应用其中。”

X AI KOLs Timeline · 2026-07-14 缓存

文章探讨了如何通过分布式系统的模式(具体来说是事件溯源)来理解AI智能体,以应对LLM的不可靠性。

0 人收藏 0 人点赞
#distributed-systems

@Greptime: 重新分区大表通常是一个迁移项目:新建表、双写、回填TB级历史数据、切换。Gr…

X AI KOLs Timeline · 2026-07-14 缓存

GreptimeDB v1.1 通过单个 ALTER TABLE 语句引入了对现有表的在线重新分区,消除了数据迁移、双写或应用程序变更的需求。它利用共享对象存储和逻辑分片来更新清单和路由,而无需在节点之间移动数据。

0 人收藏 0 人点赞
#distributed-systems

复制信念,而非比特:面向自主代理系统的Epistemic State Replication

arXiv cs.AI · 2026-07-14 缓存

本文提出了Epistemic State Replication (ESR),一种面向自主代理分布式系统的信念复制层,它将复制从数据可见性转向知识可见性,使得即使生成模型输出存在差异,也能做出语义上等效的决策。

0 人收藏 0 人点赞
#distributed-systems

精确一次执行并不存在,代理栈需要接受这一事实

Reddit r/AI_Agents · 2026-07-13

本文认为,在分布式系统中实现精确一次执行是不可能的,并且必须设计代理栈来应对这一限制。

0 人收藏 0 人点赞
#distributed-systems

Paxos 简明 (2001)[pdf]

Hacker News Top · 2026-07-09

本文简明地解释了 Paxos 算法,该算法用于在分布式系统中达成共识。

0 人收藏 0 人点赞
#distributed-systems

我的AI对我撒谎的那天,以及我为何对此感到高兴

Reddit r/AI_Agents · 2026-07-09

一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。

0 人收藏 0 人点赞
#distributed-systems

标题:我正在寻找喜欢解决正确性而非AI问题的工程师

Reddit r/artificial · 2026-07-08

作者分享了自己构建原型以验证AI生成的财务声明的经验,重点关注系统与工程挑战,如证据对账和确定性验证,并邀请志同道合的工程师进行交流。

0 人收藏 0 人点赞
#distributed-systems

Agentic IoT:体系结构、应用及迈向Internet of Agents的挑战

arXiv cs.AI · 2026-07-07 缓存

本综述论文考察了Agentic IoT作为下一代认知物联网范式,将自主AI智能体与信息物理系统集成,回顾了其体系结构、应用、挑战和未来方向。

0 人收藏 0 人点赞
#distributed-systems

@msimoni: 关于gRPC截止时间:如果客户端说“我愿意等待100毫秒”,但请求在网络传输上花费了50毫秒……

X AI KOLs Timeline · 2026-07-06

一条推文提出了关于gRPC截止时间传播的问题:如果客户端指定了100毫秒的截止时间,但网络延迟消耗了50毫秒,那么服务器是否仍然拥有完整的100毫秒?

0 人收藏 0 人点赞
#distributed-systems

恢复中的亚稳态:带有循环的级联恢复

Lobsters Hottest · 2026-07-06 缓存

讨论了级联恢复和反馈循环如何在分布式系统中导致亚稳态故障,阻止正常恢复。

0 人收藏 0 人点赞
#distributed-systems

@chessMan786: 负载均衡器:从零构建分布式系统 轮询、最少连接、一致性哈希及其他……

X AI KOLs Timeline · 2026-07-03 缓存

介绍一个从零构建负载均衡器的学习路线,涵盖轮询、最少连接、一致性哈希等算法,以及健康检查间隔等实际陷阱。

0 人收藏 0 人点赞
#distributed-systems

DeadPool:通过零开销检查点实现热插拔的弹性LLM训练

arXiv cs.LG · 2026-07-03 缓存

DeadPool 为 LLM 训练引入了一种容错机制,能够通过零开销的内存检查点实现故障节点与备用节点的热插拔,在不中断任务的情况下实现快速恢复。

0 人收藏 0 人点赞
#distributed-systems

Postgres事务是分布式系统的超能力

Hacker News Top · 2026-07-02 缓存

本文解释了如何通过与应用程序数据共置的工作流状态使用Postgres事务,来消除分布式工作流中的幂等性和原子性问题,从而实现精确一次执行。

0 人收藏 0 人点赞
#distributed-systems

Miles:用于大规模LLM强化学习后训练的PyTorch原生栈(14分钟阅读)

TLDR AI · 2026-07-01 缓存

Miles是RadixArk推出的一个开源的PyTorch原生框架,用于大规模LLM强化学习后训练,集成了SGLang、Megatron-LM和Ray,以实现高吞吐量的推演和分布式训练。

0 人收藏 0 人点赞
#distributed-systems

@Jolyne_AI: 最近在 GitHub 偶遇一本很不错的开源书:The Accidental CTO,忍不住想分享给大家。 作者不是科班出身,却一路把一个平台从零带到能扛住百万用户访问。书里讲的不是“最佳实践”的样板答案,而是踩坑、救火、复盘之后沉淀下来的…

X AI KOLs Timeline · 2026-06-30 缓存

推荐一本开源书《The Accidental CTO》,作者分享了从零到百万用户的架构演进实战经验,涵盖扩展、分布式选型、可观测性等核心内容。

0 人收藏 0 人点赞
#distributed-systems

在故障处修复:局部故障恢复的论证

Reddit r/openclaw · 2026-06-27

本文主张在分布式系统中采用局部故障恢复机制,强调在组件级别修复故障而非依赖全局恢复的好处。

0 人收藏 0 人点赞
#distributed-systems

Logical Physical Clocks and Consistent Snapshots in Globally Distributed DB [pdf]

Hacker News Top · 2026-06-27 缓存

This paper introduces logical physical clocks and methods for consistent snapshots in globally distributed databases, addressing causality and consistency challenges.

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈