low-latency

标签

Cards List
#low-latency

@levidiamode: 183/365 GPU编程 - 由@bfspector (TK合作作者, 斯坦福博士生)讲授的4.5小时CUDA + ThunderKittens课程…

X AI KOLs Timeline · 2026-07-05 缓存

强烈推荐,由Ben Spector讲授的4.5小时GPU编程课程,深入介绍CUDA和ThunderKittens,提供内核优化的幕后视角。

0 人收藏 0 人点赞
#low-latency

OpenAI 如何为 9 亿用户提供低延迟语音 AI(17 分钟阅读)

TLDR AI · 2026-07-02 缓存

OpenAI 的语音 AI 架构使用 WebRTC,并采用分离的中继-收发器设计,为 9 亿周活跃用户处理低延迟音频。

0 人收藏 0 人点赞
#low-latency

Google 推出更快速、更便宜的图像生成器 Nano Banana 2 Lite

TechCrunch AI · 2026-06-30 缓存

Google 发布了 Nano Banana 2 Lite,这是一款更快速、更便宜的 AI 图像生成器,价格为每 1000 张图像 0.034 美元,生成时间为 4 秒。该模型针对高吞吐量工作流进行了优化,可通过 Google AI Studio 和 Gemini API 使用。

0 人收藏 0 人点赞
#low-latency

@seclink: 有点意思 ....

X AI KOLs Timeline · 2026-06-26 缓存

TileRT 是一款基于 tile 的运行时,能够实现超低延迟的 LLM 推理,近期里程碑包括在万亿参数模型上达到每秒 1000+ tokens。它支持 DeepSeek-V3.2 和 GLM-5 等模型,并在 GitHub 上开源提供。

0 人收藏 0 人点赞
#low-latency

@rohanpaul_ai: AI视频正进入实时互动时代,MaineCoon如今在低延迟AI视频领域领先。@catnips_ai刚刚…

X AI KOLs Following · 2026-06-23 缓存

MaineCoon是一款22B参数的实时文生音频视频模型,在单张H100 GPU上可达47.5 FPS,支持低成本、长时长的流式生成,同步语音与画面,用于实时AI角色。

0 人收藏 0 人点赞
#low-latency

Wan-Streamer v0.1:端到端实时交互基础模型

Hugging Face Daily Papers · 2026-06-23 缓存

Wan-Streamer是一个统一的端到端多模态模型,用于实时音视频交互,采用因果注意力机制,并集成处理视觉、音频和文本模态,实现了亚秒级延迟。

0 人收藏 0 人点赞
#low-latency

可重构计算挑战:在Versal AI引擎上使用Transformer进行喷注标记

arXiv cs.LG · 2026-06-17 缓存

本文提出了一种在AMD Versal AI引擎上用于喷注标记的量化、纯整数Transformer实现,包括一个可重用的开源框架,该框架将Transformer层映射到AIE瓦片上,用于CERN LHC的低延迟触发系统。

0 人收藏 0 人点赞
#low-latency

Gemma 4 12B 原生无编码器语音输入利用建议?

Reddit r/LocalLLaMA · 2026-06-14

讨论利用 Gemma 4 12B 的无编码器架构实现原生语音输入,寻找现成的低延迟流式音频摄入解决方案。

0 人收藏 0 人点赞
#low-latency

基于LLM并行文本生成的低延迟实时音频游戏解说系统

arXiv cs.CL · 2026-06-12 缓存

本文介绍了一种低延迟实时音频游戏解说系统,该系统利用基于LLM的并行文本生成技术,将语句间的静默时间从9.6秒减少到0.3秒,与顺序基线相比显著改善了感知到的说话节奏。

0 人收藏 0 人点赞
#low-latency

[Talk] Text Diffusion — Google DeepMind's Brendan O’Donoghue

Reddit r/LocalLLaMA · 2026-06-11 缓存

DeepMind研究员Brendan O'Donoghue深入介绍文本扩散模型,通过迭代去噪生成文本,相比自回归模型延迟更低但吞吐量受限,并展示自修正和动态计算等独特优势。

0 人收藏 0 人点赞
#low-latency

Mellum by JetBrains

Product Hunt · 2026-06-11

JetBrains 发布了 Mellum,一个专为低延迟和高性能工作流设计的快速 LLM。

0 人收藏 0 人点赞
#low-latency

我们如何将Discord语音迁移到边缘

Lobsters Hottest · 2026-06-11 缓存

Discord将其超过80%的语音和视频流量迁移至Cloudflare覆盖300多个城市的边缘网络,显著降低了全球延迟和丢包率,例如法兰克福的ping值降低了34%。

0 人收藏 0 人点赞
#low-latency

Show HN: Resonate – 低延迟高分辨率频谱分析

Hacker News Top · 2026-06-06 缓存

Resonate 是一种低延迟、低内存的算法,用于对音频信号进行感知相关的频谱分析,采用带有指数加权移动平均的谐振器模型。

0 人收藏 0 人点赞
#low-latency

构建低延迟和高吞吐量AI代理的经验教训

Reddit r/AI_Agents · 2026-06-05

本文分享了构建低延迟、高吞吐量AI代理的实用经验,包括工作负载估算、令牌减少、并行处理、微服务以及处理LLM故障等。

0 人收藏 0 人点赞
#low-latency

@svpino: 人类在交谈时的平均延迟为200-250毫秒。这款语音模型甚至更快:仅110…

X AI KOLs Following · 2026-06-03

一款开放权重的8B参数语音模型仅需110毫秒延迟,比人类平均对话延迟200-250毫秒更快。它可以在本地运行,并通过GitHub仓库免费获取。

0 人收藏 0 人点赞
#low-latency

@omarsar0: 又一个超棒的开源发布。Miso One 是一个8B参数文本转语音模型,具备真实情感范围,因此配音…

X AI KOLs Following · 2026-06-03 缓存

Miso One 是一个开源的8B参数文本转语音模型,具备真实情感范围和110毫秒延迟,专为配音工作设计。

0 人收藏 0 人点赞
#low-latency

为什么最近更多人提到 LuMay Voice Agent?

Reddit r/AI_Agents · 2026-05-29

LuMay Voice Agent 因其专注于业务工作流程、内置CRM与自动化、企业合规性以及可靠的现实通话能力而受到关注。

0 人收藏 0 人点赞
#low-latency

google/magenta-realtime-2

Hugging Face Models Trending · 2026-05-28 缓存

Google DeepMind 发布了 Magenta RealTime 2,这是一个开源音乐生成模型,支持设备端流式处理,可通过文本、音频示例和 MIDI 实现低延迟控制。

0 人收藏 0 人点赞
#low-latency

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers · 2026-05-28 缓存

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

0 人收藏 0 人点赞
#low-latency

面向低延迟多智能体工具调用的有状态推理架构

arXiv cs.LG · 2026-05-27 缓存

本文提出了一种用于多智能体工具调用的有状态推理架构,该架构在多次调用之间复用KV缓存,并采用推测解码技术,相较于vLLM和SGLang,在智能体工作流上实现了2.1倍至4.2倍的加速。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈