batching

标签

Cards List
#batching

服务掩码扩散大语言模型:基于真实硬件的特性分析与设计原则

arXiv cs.AI · 2026-08-26 缓存

本文利用真实硬件测量,表征了掩码扩散语言模型(dLLMs)的服务行为,识别了与自回归模型的关键区别,并推导出高效推理系统的设计原则。

0 人收藏 0 人点赞
#batching

我测试了2个本地代理是否并行运行还是轮流使用1个模型。批处理是真实的,但使用QWEN 3.8 27B 4bit在MacBook Pro M3Max 128GB统一内存40核GPU上并非没有代价

Reddit r/AI_Agents · 2026-08-18

作者在MacBook Pro M3Max上使用QWEN 3.8 27B 4bit模型进行了两个本地代理并行运行的实验,发现批处理可以实现并发执行,但会增加延迟,最佳代理数约为4个。

0 人收藏 0 人点赞
#batching

不,本地模型不会赢

Lobsters Hottest · 2026-08-11 缓存

评论文章,认为本地 AI 模型永远不会赢,因为它们比数据中心推理更弱、更昂贵且效率更低,原因在于批处理和 GPU 优势。

0 人收藏 0 人点赞
#batching

Making Postgres 300x faster for analytics: batching, operator fusion, and SIMD

Hacker News Top · 2026-08-07 缓存

pgrust 0.2 rebuilds the Postgres query engine with batching, operator fusion, and SIMD, achieving 300x faster analytical queries and 30% faster OLTP than Postgres.

0 人收藏 0 人点赞
#batching

BatchDAG:面向企业数据的可扩展即席分析的LLM规划执行图

arXiv cs.AI · 2026-07-22 缓存

BatchDAG提出了一种系统,其中LLM生成具有类型的操作有向无环图,用于对企业数据进行可扩展的即席分析,实现了LLM调用次数减少高达47倍,并在超过50,000场会议中实现低于60秒的查询时间。

0 人收藏 0 人点赞
#batching

使用 hijax 定义新的 JAX 类型

Hacker News Top · 2026-07-12 缓存

本文档介绍了 hijax 类型,这是 JAX 的一项新功能,允许定义具有自身不变量、切线类型、批处理和分片行为的自定义类型,并通过量化数组的示例进行说明。

0 人收藏 0 人点赞
#batching

@injaneity: https://x.com/injaneity/status/2075659478096376158

X AI KOLs Timeline · 2026-07-10 缓存

本文解释了批处理和并行操作如何改善AI计算机使用系统中的延迟和效率,重点介绍了pi-computer-use和cua-driver等开源实现,它们在Codex出现类似功能之前就取得了显著的性能提升。

0 人收藏 0 人点赞
#batching

@athleticKoder:一篇关于LLM推理原理的1600字笔记,涵盖:1. 注意力机制——token交互的唯一场所 2. KV缓存——为何...

X AI KOLs Timeline · 2026-07-02 缓存

一篇详细阐述LLM推理关键概念的推文:注意力机制、KV缓存、分块预填充以及批处理技术,包括vLLM和SGLang中使用的连续批处理。

0 人收藏 0 人点赞
#batching

大规模LLM推理开放手册(GPU内部机制、KV缓存、批处理、vLLM/SGLang/TensorRT-LLM)[P]

Reddit r/MachineLearning · 2026-06-20

一本正在编写中的开放手册,解释LLM推理内部机制,包括GPU内存层次结构、KV缓存、批处理以及vLLM和TensorRT-LLM等流行推理引擎。

0 人收藏 0 人点赞
#batching

为什么你的智能体在温度0时仍会给出不同的答案?

Reddit r/AI_Agents · 2026-06-04

将温度设置为0并不能保证智能体中的工具调用具有确定性,原因在于批处理推理会导致浮点数归约顺序发生变化,从而引发token翻转,并在负载下产生不同的动作。

0 人收藏 0 人点赞
#batching

@LangChain: https://x.com/LangChain/status/2061864647884464430

X AI KOLs Following · 2026-06-02 缓存

LangChain和Harvey的一项研究探索了通过分批标准评估和使用开源模型来降低验证法律代理输出成本的方法,实现了数量级的成本节约,同时保持了接近前沿的性能。

0 人收藏 0 人点赞
#batching

@Greptime: 关于Prometheus远程写入,瓶颈并非网络或memtable——而是Region Worker在dec…时持有&mut

X AI KOLs Following · 2026-06-02 缓存

GreptimeDB v1.0引入了Pending Rows Batcher,这是一个三阶段流水线,将CPU密集型工作从Datanode的关键路径上移开,使Prometheus远程写入吞吐量从120万提升到217万points/sec,并将Datanode的CPU使用率降低20%。

0 人收藏 0 人点赞
#batching

基于阈值的LLM推理独占批处理

arXiv cs.AI · 2026-06-02 缓存

本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。

0 人收藏 0 人点赞
#batching

@adrgrondin: 使用Codex CLI和@lmstudio在MacBook Pro M5上本地同时运行子代理以审查代码并查找漏洞……

X AI KOLs Following · 2026-05-20 缓存

演示了在MacBook Pro M5上使用Codex CLI和LM Studio(搭载Qwen 3.6,并利用MLX批处理功能)本地运行子代理以进行代码审查和漏洞检测。

0 人收藏 0 人点赞
#batching

@lmstudio: 视觉模型的批处理功能在我们的最新MLX引擎更新中现已进入Beta测试阶段。此更新还带来了主要……

X AI KOLs Following · 2026-05-14 缓存

LM Studio 宣布其 MLX 引擎的 Beta 更新,引入了视觉模型的批处理功能和改进的缓存,以加速推理。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈