标签
An annotated from-scratch reimplementation of Google's DiffusionGemma, a 26B open-weight state diffusion language model, explaining its architecture, sampling procedure, and design choices.
一篇关于企业级语音AI架构的技术解析,该架构通过批发运营商将电话成本降低40-60%,并利用Deepgram、Claude/GPT-4o-mini和ElevenLabs/Cartesia实现低于500毫秒的延迟,通过n8n和Supabase进行编排。
据报道,Pathway的BDH(一种后Transformer架构)在标准GPU上从零训练时,在10M到1B参数范围内匹配GPT-2的缩放性能。
在 AI Engineer 演讲中,Cognition 联合创始人 Walden Yan 不建议使用多智能体系统,称它们很脆弱,而 Devin 背后的团队现在使用的是具有连贯上下文的单一智能体。
一篇观点文章,批判性地解构了AI智能体自主性的架构幻觉,认为思维链和多智能体系统只是由脚本编排的文本预测把戏,而非真正的推理或独立。
@venkateshdotdev 的一条推文,列出了10个具有挑战性的系统设计面试题,涵盖URL缩短器、扩展、一致性、限流、容错以及处理流量高峰。
从分布式系统工程的视角解释AT协议架构,涵盖从SQL到NoSQL再到流处理的转变,以及AT协议如何将这些服务外部化以实现去中心化后端。
介绍 The Architect,一个 Claude Code 插件,能在写代码前通过访谈生成完整项目蓝图,支持 14 种项目类型,帮助避免架构跑偏和推倒重来。
一条推文,汇集了40家顶级科技公司的工程博客,帮助你从真实世界的生产实战手册中学习系统设计和架构。
对 NVIDIA Vera 白皮书的一篇分析性评论,审视了 Olympus 核心令人印象深刻的架构,同时认为该论文的反 x86 叙事和基准测试主张被夸大了,而独立测试表明该硬件确实强大。
一位独立开发者更新了 AttnRes 项目:用基于注意力的路由替代标准残差流,通过渐进式切换计划和 top-K logits 从 Gemma 4 31b 进行蒸馏,并计划推出一个 Apache 2.0 社区模型。
Google Developers 以主题帖形式分享了开发者社区提供的五条架构建议,用于构建更好、更可靠的AI智能体。
Intern-S2 Mobius 是一个基于 Qwen3.5-35B 的模型,其架构差异据称可提高吞吐量并减少 token 消耗。
Arya Dradjica 撰写的一篇详细博客文章,描述了为 Rust 编译器 Krabby 设计查询系统的过程。文章解释了为什么基于拉取的架构优于基于推送的架构,并概述了期望的功能特性。
苏剑林对K3架构进行复盘,核心为KDA + MLA + Stable LatentMoE + AttnRes的组合,讲解其设计取舍、MoE稳定性改进、为何保留MLA,以及DSV4与MLA的关系。
Kiro 工程团队解释了如何将三个特定客户端的智能体框架(IDE、CLI、Web)整合为单一的智能体框架,从而在笔记本电脑、云端和移动端实现无缝的会话连续性。
OpenAI 宣布推出 GPT-Live,这是一种用于实时音频的新架构和技术栈,能够在说话的同时聆听,通过连续音频流实现更深入的推理和工具使用,且不会打断对话。
文章认为,在最终一致的分布式系统中重试消息会将正常状态误判为故障,并建议改为存储传入数据,待所有前置条件到达后再处理,从而无需重试和死信队列。
一条推文展示将户型图交给AI,按指定风格(如京都风格)直接生成3D效果图的玩法,反映当前3D生成模型的强大能力。