agentic-workloads

标签

Cards List
#agentic-workloads

@ArizePhoenix: 定价为每百万输入/输出token 10美元/50美元,缓存读取费用降低75%,至每百万token 0.25美元。Anthropic声称典型成本降低约25%…

X AI KOLs Following · 6天前

Anthropic宣布其AI模型API的定价变更,输入token和输出token的费率分别为每百万10美元和50美元,且缓存读取成本降低75%。该公司声称这些变更使典型成本降低约25%,对于代理工作负载可节省高达45%。

0 人收藏 0 人点赞
#agentic-workloads

@SemiAnalysis_: AMD团队正在全力以赴。尽管对于大多数SLOs/开源模型来说,AMD落后于NVIDIA,但我们认为AMD的软件……

X AI KOLs Timeline · 2026-08-30 缓存

AMD正在努力改进其软件以应对AI工作负载,特别是在代理任务方面,有潜力在性能与价格比上超越NVIDIA,但目前的软件和领导层问题阻碍了进展。

0 人收藏 0 人点赞
#agentic-workloads

注意缓存读取成本

Lobsters Hottest · 2026-08-10 缓存

一篇博客文章,解释了在代理型工作负载中,缓存读取成本主导了LLM推理开销,随着每轮重新读取上下文,累计成本呈二次方增长,并建议减少工具调用次数以降低成本。

0 人收藏 0 人点赞
#agentic-workloads

@omarsar0: TokTier makes tokenization stateful for agentic serving. Across 153,951 real agent calls with a 94.1% prompt-cache hit …

X AI KOLs Following · 2026-08-03 缓存

TokTier is a stateful tokenization service that cuts tokenization overhead in agentic LLM serving by reusing stable token boundaries and running exact CPU/GPU tokenization, reducing time-to-first-token by 16–34% under vLLM.

0 人收藏 0 人点赞
#agentic-workloads

持续统一数千个智能体的工作

Reddit r/AI_Agents · 2026-07-28

描述了一种方法,用于在并行预测任务中统一数千个智能体的输出,通过后处理和同质任务设计实现一致性和成本效率。

0 人收藏 0 人点赞
#agentic-workloads

@KVCache_AI: Mooncake现在支持KV缓存的SSD卸载。随着智能体工作负载成为常态,KV缓存的生存时间正在…

X AI KOLs Timeline · 2026-07-15 缓存

Mooncake宣布支持KV缓存的SSD卸载,能够经济高效地将KV缓存容量扩展到DRAM之外,适用于长时间运行的智能体工作负载。分析显示,双峰复用模式使得分层存储更加高效。

0 人收藏 0 人点赞
#agentic-workloads

我在65K-128K上下文下对13个模型进行了基准测试,以找出对于代理工作负载真正重要的因素

Reddit r/LocalLLaMA · 2026-07-05

对13个本地LLM在65K-128K上下文下的广泛基准测试表明,预填充速度主导了代理工作负载性能(占实际时间的94-99%),使tg128指标具有误导性,并且KV头数量是比参数量或MoE/密集设计更关键的架构因素。

0 人收藏 0 人点赞
#agentic-workloads

DualPath: 破解智能体LLM推理中的存储带宽瓶颈

Reddit r/singularity · 2026-06-24 缓存

DualPath是一种通过引入双路径KV-cache加载机制来打破智能体LLM推理中存储带宽瓶颈的系统,离线吞吐量提升可达1.87倍,在线吞吐量提升可达1.96倍。

0 人收藏 0 人点赞
#agentic-workloads

@m_sirovatka: KV Cache 重用是代理工作负载推广中最重要的部分。我们已经将 Mooncake Store 集成到 prime-rl 中,与 vL…

X AI KOLs Following · 2026-06-02 缓存

vLLM 集成了 Mooncake Store 用于分布式 KV 缓存重用,支持跨节点前缀缓存,高效服务具有高令牌重用的代理工作负载。

0 人收藏 0 人点赞
#agentic-workloads

@zhyncs42: Qwen推理团队非常棒——他们在TokenSpeed上针对智能体工作负载实现了540 TPS,期待他们...

X AI KOLs Timeline · 2026-05-24 缓存

Qwen推理团队宣布了TokenSpeed,这是一个针对智能体工作负载的高性能LLM推理引擎,实现了540 TPS,并提供开源预览版。

0 人收藏 0 人点赞
#agentic-workloads

TokenSpeed:面向智能体工作负载的"光速"LLM推理引擎(5分钟阅读)

TLDR AI · 2026-05-07 缓存

Lightseek发布TokenSpeed,一款面向智能体工作负载优化的高性能LLM推理引擎,采用编译器驱动的并行技术和先进的内核优化,相关技术已被vLLM采纳。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈