parallelism

标签

Cards List
#parallelism

你不需要多智能体架构

Reddit r/AI_Agents · 8小时前

一篇文章指出多智能体架构常被过度使用,根据任务并行性和协调需求提供何时使用单智能体与多智能体架构的指南。

0 人收藏 0 人点赞
#parallelism

@yibie: 推荐这篇 LangChain CEO Harrison Chase 写的多 agent 系统设计指南。核心论题极其简单但很少有人讲清楚:多 agent 系统分"读"和"写"——读容易并行,写容易冲突。这就是为什么 Anthropic 的研…

X AI KOLs Timeline · 2026-07-11 缓存

推荐Harrison Chase关于多agent系统设计指南的博客,核心观点是多agent系统分'读'和'写',读易并行,写易冲突,并总结了适合与不适合的场景以及工程配套。

0 人收藏 0 人点赞
#parallelism

@injaneity: https://x.com/injaneity/status/2075659478096376158

X AI KOLs Timeline · 2026-07-10 缓存

本文解释了批处理和并行操作如何改善AI计算机使用系统中的延迟和效率,重点介绍了pi-computer-use和cua-driver等开源实现,它们在Codex出现类似功能之前就取得了显著的性能提升。

0 人收藏 0 人点赞
#parallelism

Rob Pike – '并发并非并行' [视频] (2012)

Hacker News Top · 2026-07-04 缓存

Rob Pike在2012年的演讲解释了并发与并行的区别,强调并发是关于独立执行任务的组合,而并行是关于同时执行。这场演讲是计算机科学教育中的经典之作。

0 人收藏 0 人点赞
#parallelism

@pauliusztin_: 我曾以为将1,000,000份文档摄入AI记忆系统主要是个计算问题。但我一直被证明是错的……

X AI KOLs Timeline · 2026-07-04 缓存

作者讨论了将AI记忆摄入从数千份扩展到数百万份文档的架构,强调编排和并行性而非原始计算能力,并使用Prefect进行工作流管理。

0 人收藏 0 人点赞
#parallelism

从单GPU升级到双GPU体验不错,但并非如我所料

Reddit r/LocalLLaMA · 2026-06-29

作者分享,从单个24GB GPU升级到双24GB GPU后,LLM性能提升并非通过更大模型实现,而是通过并行性:使用一个主编排代理配合多个较小的子代理,从而提高了编码任务的整体吞吐量。

0 人收藏 0 人点赞
#parallelism

@divaagurlxw: 如果我想让LLM响应低于一秒,我会研究的推理优化方法:1.KV-Caching 2.Speculative Decoding 3.FlashAtte…

X AI KOLs Timeline · 2026-06-29 缓存

一条推文列出了16种推理优化技术,用于实现低于一秒的LLM响应,包括KV缓存、推测解码、FlashAttention和各种并行化方法。

0 人收藏 0 人点赞
#parallelism

@0xMorlex: https://x.com/0xMorlex/status/2070079645148451263

X AI KOLs Timeline · 2026-06-25 缓存

从单个AI智能体过渡到协调的智能体集群的详细路线图,涵盖何时拆分、如何无冲突地运行并行子智能体,以及如何使用Claude Code原语在大规模下保持系统稳定。

0 人收藏 0 人点赞
#parallelism

加速视觉生成式LLMs的解耦RL:基于扩散并行与训练器辅助生成

arXiv cs.AI · 2026-06-24 缓存

本文介绍了DigenRL,一个用于基于扩散的生成式LLMs的解耦RL框架,它利用生成轴流水线并行和训练器辅助生成,相比现有系统实现了1.56-2.10倍的吞吐量提升。

0 人收藏 0 人点赞
#parallelism

PivCo-Huffman “合并”操作

Lobsters Hottest · 2026-06-22 缓存

这篇博客分析了PivCo-Huffman论文,该论文引入了并行Huffman解码的“合并”操作,无需交错开销即可实现高效的向量化和GPU友好解码。

0 人收藏 0 人点赞
#parallelism

@charles_irl: 重写并行是一项重大举措,如果能比我们用CuTe DSL实现的速度更快就好了。FA4是一个非常…

X AI KOLs Following · 2026-06-11 缓存

关于使用CuTe DSL和瓦片编程模型重写并行性以提升FA4 (FlashAttention 4) 内核性能的讨论。

0 人收藏 0 人点赞
#parallelism

@charles_irl: 给不关心FA4在softmax与MMA负载上分配多少warpgroup的人的tl;dr。推理与训练不…

X AI KOLs Following · 2026-06-11 缓存

解释推理内核与训练不同,Flash Attention 4 侧重于改变跨KV的并行性并支持小型不规则负载。

0 人收藏 0 人点赞
#parallelism

@yukangchen_: 很高兴分享我们的新博客:利用并行化扩展视频训练 https://research.nvidia.com/labs/eai/blogs/scali…

X AI KOLs Following · 2026-06-08 缓存

这篇来自NVIDIA Research的博客讨论了序列并行化如何扩展长视频训练系统,既支持理解任务也支持生成任务,解决了在多GPU上适配超长视频序列的挑战。

0 人收藏 0 人点赞
#parallelism

构建低延迟和高吞吐量AI代理的经验教训

Reddit r/AI_Agents · 2026-06-05

本文分享了构建低延迟、高吞吐量AI代理的实用经验,包括工作负载估算、令牌减少、并行处理、微服务以及处理LLM故障等。

0 人收藏 0 人点赞
#parallelism

@swyx:Kakuna:一种仅知道如何加固代码库的技能清单 / 用它规划,然后让它 / 目标一天,它……

X AI KOLs Following · 2026-05-22 缓存

Kakuna 是一种通过自动化繁琐任务来加固代码库的技能,它能生成可用于生产的提交并附带审计记录,同时将对如何为人类和智能体访问设计应用的观点编码到其中,专注于子智能体并行和“鲻鱼工厂”方法。

0 人收藏 0 人点赞
#parallelism

@levidiamode: Day 138/365 of GPU Programming 今年我最喜欢的讲座之一是斯坦福大学的CS336第7讲关于GPU…

X AI KOLs Timeline · 2026-05-21 缓存

一位学习者分享了对斯坦福大学CS336第7讲关于GPU并行性的热情,该讲座涵盖了基本操作,并将其连接到多GPU设置以及张量并行、数据并行和流水线并行等技术。

0 人收藏 0 人点赞
#parallelism

DynaTrain: 面向弹性大语言模型训练的快速在线并行度切换

arXiv cs.LG · 2026-05-20

DynaTrain 是一个分布式训练系统,能够在大语言模型上实现亚秒级在线并行度重配置,通过虚拟参数空间抽象,使转换速度比现有方法快多达三个数量级。

0 人收藏 0 人点赞
#parallelism

SNLP: 基于结构化牛顿校正的层并行推理

Hugging Face Daily Papers · 2026-05-18 缓存

本文介绍了SNLP,这是一个通过用结构化近似替代精确牛顿校正来实现Transformer层并行推理的框架,在0.5B模型上实现了高达2.3倍的加速,同时降低了困惑度。

0 人收藏 0 人点赞
#parallelism

预训练并行化与失败训练运行笔记(12分钟阅读)

TLDR AI · 2026-05-18 缓存

一篇技术深度文章,探讨大型语言模型中预训练运行失败的常见原因,包括专家路由中的因果破坏问题和数值精度错误,并附有Llama 4、Gemini 2 Pro和GPT-4的示例。

0 人收藏 0 人点赞
#parallelism

OxCaml 中的数据竞态自由

Lobsters Hottest · 2026-05-16 缓存

OxCaml 是 Jane Street 对 OCaml 编译器的分支,它引入了编译时对数据竞态的保证,从而在不增加运行时开销的情况下实现顺序一致性。这篇博文解释了新的模式轴及其对并行编程的影响。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈