latency

标签

Cards List
#latency

@TheAhmadOsman: 真的,人们怎么能继续忍受这些慢得要死的云模型?和我自托管的任何东西相比,它们慢得令人痛苦…

X AI KOLs Timeline ↗ · 2天前 缓存

一条推文,批评云AI模型与自托管解决方案相比性能缓慢。

0 人收藏 0 人点赞
#latency

最佳情况下的 Voice AI 延迟

Reddit r/AI_Agents ↗ · 5天前

一条推文讨论了关于 Voice AI 系统实现 80ms 延迟的说法,对其使用定制模型和本地部署推理的可行性提出了疑问。

0 人收藏 0 人点赞
#latency

JEV 几乎消亡:CLM 与 JEV 对比

Reddit r/LocalLLaMA ↗ · 6天前

对比语言模型(CLM)被介绍为 TypeSafe AI 的 JEV 的开源权重替代品,提供功能对等性,并具有改进的延迟和微调能力,尽管在泛化方面存在权衡。

0 人收藏 0 人点赞
#latency

为什么没人告诉我Redis哈希槽的事?

Lobsters Hottest ↗ · 6天前 缓存

作者解释了他们如何通过利用Redis哈希槽来正确处理Redis集群中的批操作,从而优化了配送服务的路由引擎延迟。

0 人收藏 0 人点赞
#latency

@yoheinakajima: 在本地将对象检测延迟降低到0.35秒以下

X AI KOLs Timeline ↗ · 2026-09-23 缓存

一位开发者分享了在本地硬件上将对象检测延迟降低到0.35秒以下的成就,突显了人工智能性能优化的进展。

0 人收藏 0 人点赞
#latency

当模型能力、策略、成本和延迟冲突时,如何路由代理请求?

Reddit r/AI_Agents ↗ · 2026-09-23

作者讨论了当模型能力、策略、成本和延迟冲突时,路由AI代理请求的设计方法,询问生产经验中的权衡和策略。

0 人收藏 0 人点赞
#latency

@taroleo: 当从美国西海岸调用 Jev 时,单个请求编译 6 个问题大约需要 130 毫秒,或每个判断 20-25 毫秒。

X AI KOLs Timeline ↗ · 2026-09-21

该推文突出了从美国西海岸调用 Jev 的低延迟和可扩展性,每个请求处理 6 个问题需要 130 毫秒,并且在高并行性下延迟几乎恒定,表明设计良好,并且随着专业模型的增加,未来潜力更大。

0 人收藏 0 人点赞
#latency

试用 TypeSafe AI 的 Jev 与常规 LLM 进行模型路由,延迟差异相当明显

Reddit r/AI_Agents ↗ · 2026-09-20

作者对比了 TypeSafe AI 的 Jev 模型与常规 LLM 在模型路由上的表现,发现 Jev 将延迟显著降低至约1秒,而常规 LLM 需要4-14秒,这使得它对于快速决策层颇具前景。

0 人收藏 0 人点赞
#latency

@ArizePhoenix: 70至500毫秒延迟,0%类型错误,每次回答都校准概率,输入$0.042/MTok且输出免费。当决策…

X AI KOLs Following ↗ · 2026-09-18 缓存

Arize Phoenix 推出一款工具,提供低延迟(70-500毫秒)、零类型错误、概率校准及低成本($0.042/MTok),强调了代码决策可观测性的重要性。

0 人收藏 0 人点赞
#latency

@cyrusasg:推理服务是自动化研究最干净的目标之一。目前很多注意力集中在内核生成,但……

X AI KOLs Timeline ↗ · 2026-09-15 缓存

这条推文将推理服务确定为自动化研究的主要目标,强调在延迟、质量和吞吐量约束下的端到端优化,在统一搜索空间中涵盖各个方面,并暗示了未来的发展。

0 人收藏 0 人点赞
#latency

通过 GRAND 闭合 IPv6 首包间隙

Hacker News Top ↗ · 2026-09-15

本文将 GRAND 作为一种方法提出,以解决 IPv6 首包延迟问题,通过闭合初始数据包传输中的间隙来提升网络性能。

0 人收藏 0 人点赞
#latency

@dongxi_nlp: https://x.com/dongxi_nlp/status/2099713825402425623

X AI KOLs Timeline ↗ · 2026-09-15 缓存

本文解释了AI模型中预填充和解码阶段的工作原理,以及它们对生成速度和性能的影响,帮助理解AI响应延迟的成因。

0 人收藏 0 人点赞
#latency

语音AI架构讨论

Reddit r/AI_Agents ↗ · 2026-09-14

本文讨论了语音AI架构中延迟与控制之间的权衡,比较了传统级联系统与端到端模型,并寻求社区对当前实践的反馈。

0 人收藏 0 人点赞
#latency

Cloudflare AKE 将源站 HelloRetryRequests 从 52% 降至 3.7%

Hacker News Top ↗ · 2026-09-14 缓存

Cloudflare 推出自动密钥交换功能,通过探测源站服务器偏好来优化 TLS 1.3 握手,从而降低连接延迟并自动启用后量子安全保护。

0 人收藏 0 人点赞
#latency

如何比较同一代理工作流中的本地模型和托管模型?

Reddit r/AI_Agents ↗ · 2026-09-10

本文讨论了在同一代理工作流中比较本地和托管AI模型的挑战,特别是Raycast v2.2更新后可以通过各种提供商路由工作流。文章寻求构建提供商中立评估的建议,并指出工具支持和延迟等变量最难保持恒定。

0 人收藏 0 人点赞
#latency

@Modular: Hippocratic AI的健康助手每天呼叫数万名患者。每轮对话必须在约800毫秒内完成。

X AI KOLs Timeline ↗ · 2026-09-09 缓存

Hippocratic AI的健康代理每天处理数万名患者呼叫,要求响应时间低于800毫秒以维持自然交互,因此与Modular合作。

0 人收藏 0 人点赞
#latency

GLM得分高于GPT,但如何验证基准测试的有效性?

Reddit r/ArtificialInteligence ↗ · 2026-09-04

文章比较了GLM-5.3与GPT-5.5等AI模型在基准测试中的性能指标,强调了成本效益并质疑基准测试的效度,同时探讨高效的方法论评估方式。

0 人收藏 0 人点赞
#latency

为什么多代理RAG管道在生产数据库上卡顿(以及拯救我们的架构)

Reddit r/AI_Agents ↗ · 2026-09-03

文章讨论了多代理RAG管道在生产中因同步工具调用和上下文膨胀而导致高延迟的原因,并提出了微代理、使用Redis缓存和异步处理等解决方案来提高性能。

0 人收藏 0 人点赞
#latency

LLM护栏的思维模型,终于让我明白了。

Reddit r/AI_Agents ↗ · 2026-09-03

这篇文章概述了一种思维模型,将LLM护栏作为独立层次实施入站和出站检查,强调需要超越系统提示的强制执行,以及与延迟的权衡。

0 人收藏 0 人点赞
#latency

不是所有事情都需要代理——我用来决定使用代理还是脚本的三个问题

Reddit r/AI_Agents ↗ · 2026-09-03

作者分享了三个问题,用于决定在AI代理和脚本之间选择,强调了程序知识、项目数量和独立性,以及成本和速度的权衡。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈