标签
本文认为,AI代理系统中的失败可以通过分布式系统的视角来理解,并将代理行为与经典的分布式系统问题进行类比。
对联邦可解释人工智能(FedXAI)的系统性综述,涵盖角色、架构、评估实践和开放挑战。提出了一个多轴分类法,讨论了从模型无关到可解释性设计的方法,强调了标准化和隐私感知评估方面的空白。
对三个工作流系统(Obelisk、Temporal、Restate)实现天气预报工作流的技术比较,重点突出架构、Rust API、确定性边界和部署模型等方面的差异。
文章探讨了如何通过分布式系统的模式(具体来说是事件溯源)来理解AI智能体,以应对LLM的不可靠性。
GreptimeDB v1.1 通过单个 ALTER TABLE 语句引入了对现有表的在线重新分区,消除了数据迁移、双写或应用程序变更的需求。它利用共享对象存储和逻辑分片来更新清单和路由,而无需在节点之间移动数据。
本文提出了Epistemic State Replication (ESR),一种面向自主代理分布式系统的信念复制层,它将复制从数据可见性转向知识可见性,使得即使生成模型输出存在差异,也能做出语义上等效的决策。
一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。
作者分享了自己构建原型以验证AI生成的财务声明的经验,重点关注系统与工程挑战,如证据对账和确定性验证,并邀请志同道合的工程师进行交流。
本综述论文考察了Agentic IoT作为下一代认知物联网范式,将自主AI智能体与信息物理系统集成,回顾了其体系结构、应用、挑战和未来方向。
一条推文提出了关于gRPC截止时间传播的问题:如果客户端指定了100毫秒的截止时间,但网络延迟消耗了50毫秒,那么服务器是否仍然拥有完整的100毫秒?
介绍一个从零构建负载均衡器的学习路线,涵盖轮询、最少连接、一致性哈希等算法,以及健康检查间隔等实际陷阱。
DeadPool 为 LLM 训练引入了一种容错机制,能够通过零开销的内存检查点实现故障节点与备用节点的热插拔,在不中断任务的情况下实现快速恢复。
本文解释了如何通过与应用程序数据共置的工作流状态使用Postgres事务,来消除分布式工作流中的幂等性和原子性问题,从而实现精确一次执行。
Miles是RadixArk推出的一个开源的PyTorch原生框架,用于大规模LLM强化学习后训练,集成了SGLang、Megatron-LM和Ray,以实现高吞吐量的推演和分布式训练。
推荐一本开源书《The Accidental CTO》,作者分享了从零到百万用户的架构演进实战经验,涵盖扩展、分布式选型、可观测性等核心内容。
This paper introduces logical physical clocks and methods for consistent snapshots in globally distributed databases, addressing causality and consistency challenges.