real-time

标签

Cards List
#real-time

评估实时语音代理:从组件质量到扎实成果

arXiv cs.AI ↗ · 昨天 缓存

这篇综述论文评估实时语音代理,通过提出一个分类法和一个名为TRG的最低报告标准,以解决语音建模、轮次转换和代理评估社区中的碎片化问题。

0 人收藏 0 人点赞
#real-time

Sayble

Product Hunt ↗ · 昨天 缓存

Sayble 是一款 AI 助手,在销售通话和会议中提供实时建议,并支持自动总结和邮件生成。它支持多平台和多种语言,以提升沟通生产力。

0 人收藏 0 人点赞
#real-time

@Saboo_Shubham_: 太疯狂了。语音AI代理每两周都在进步。我正在和我的保险索赔语音代理的实时虚拟形象对话…

X AI KOLs Following ↗ · 3天前 缓存

一个具有实时虚拟形象的开源语音AI代理能够实时看、说、思考和绘画,并支持多语言交互,例如在通话中途切换到印地语。

0 人收藏 0 人点赞
#real-time

@SafaElmali: 我使用 Opus 5.5 构建了一个网站,在夜间像素艺术城市上播放无尽的 lofi 音乐。音乐不是播放列表。一首全新的……

X AI KOLs Following ↗ · 3天前 缓存

一个免费的网页应用,将动画像素艺术城市夜景与使用AI在浏览器中实时生成的无尽lofi音乐配对,为工作或放松提供平静的背景。

0 人收藏 0 人点赞
#real-time

发布 Gemini 3.8 Live 配备 Live Avatar

Google DeepMind Blog ↗ · 4天前 缓存

Google 推出 Gemini 3.8 Live with Live Avatar,这是一项更新,将实时视觉虚拟形象集成到对话式 AI 中,通过唇形同步、多语言支持和异步工具执行等功能增强交互,适用于企业应用。

0 人收藏 0 人点赞
#real-time

@odysseyml: 介绍 Agora-2,我们的下一代多智能体世界模型。Agora-2 支持多达20个人类和智能体互动…

X AI KOLs Following ↗ · 4天前 缓存

OdysseyML 推出了 Agora-2,一个下一代多智能体世界模型,支持多达20个人类和智能体在共享模拟环境中实时互动,多人研究预览现已可用。

0 人收藏 0 人点赞
#real-time

Nagi 是一个全新的开源快速决策模型

Reddit r/ArtificialInteligence ↗ · 5天前

Nagi 是一个全新的开源快速决策模型,在实时游戏场景中持续优于其他模型,如 laya 和 semif。

0 人收藏 0 人点赞
#real-time

**识别谁在何时说话:使用 NVIDIA Nemotron 3 Diarization 构建实时、多说话人 AI**

Hugging Face Blog ↗ · 6天前 缓存

NVIDIA 发布了 Nemotron 3 Diarization,这是一个开源100M参数模型,实现了最先进的说话人识别,错误率为14.72%,支持最多八名说话人的实时和离线处理。

0 人收藏 0 人点赞
#real-time

@SamuelZengML: 语音识别很容易——直到你要求它永远倾听。今日我们开源 Audio8 ASR Infinite:超低延迟…

X AI KOLs Following ↗ · 6天前 缓存

开源 Audio8 ASR Infinite,一种具有超低延迟、无限制音频支持、24/7转录和内置语义轮次检测的语音识别工具,据称是流式ASR的新技术标杆。

0 人收藏 0 人点赞
#real-time

GitHub - MatiwosKebede/OpenTrainDNN: OpenTrainDNN: 基于浏览器的实时神经网络可视化工具

Reddit r/artificial ↗ · 6天前 缓存

OpenTrainDNN 是一个开源的客户端Web应用,它能在浏览器中实时可视化深度神经网络的训练过程,包括反向传播和权重更新。

0 人收藏 0 人点赞
#real-time

@interjc:今日,据称使用Claude Opus 5.5制作的鹈鹕骑自行车提示词已达到SSR评级——值得一试该提示词……

X AI KOLs Timeline ↗ · 6天前 缓存

使用Claude Opus 5.5生成的提示词可创建一个鹈鹕骑自行车的交互式3D场景,包含物理模拟、成就系统及基于浏览器的实时音效。

0 人收藏 0 人点赞
#real-time

@xiangxiang103: 这太令人印象深刻了!Hugging Face本周放出了一匹黑马——同时在两个赛道上占据主导地位。Spe…

X AI KOLs Timeline ↗ · 6天前 缓存

NetEase Youdao的开源AI模型R2T2和T3PO在Hugging Face的语音识别和翻译排行榜上名列前茅,凭借令人印象深刻的实时性能和稳定性超越了主要竞争对手。

0 人收藏 0 人点赞
#real-time

Speechka

Product Hunt ↗ · 6天前 缓存

Speechka是一款实时语音翻译工具,能够模仿用户的声音,支持44种语言,适用于macOS、Windows和浏览器。

0 人收藏 0 人点赞
#real-time

@yifanzhang_: 非常有趣的模型架构,使用了块稀疏注意力机制。 https://pixverse.ai/en/blog/pixverse-r2-scaling-r…

X AI KOLs Timeline ↗ · 6天前 缓存

PixVerse R2 引入了一种统一的缩放架构,用于实时视听世界模型,利用块稀疏注意力机制和持续预训练来增强视频生成和交互控制。

0 人收藏 0 人点赞
#real-time

展示HN:InstinctFlash – 在Jetson Thor上实时运行5B世界动作模型

Hacker News Top ↗ · 6天前 缓存

InstinctFlash是一个高性能的机器人模型服务框架,可在Jetson Thor上实现实时推理5B世界动作模型,据报道速度提升高达33.78倍。

0 人收藏 0 人点赞
#real-time

@yoheinakajima: 快得足以用于实时情感检测器

X AI KOLs Following ↗ · 2026-09-22 缓存

Yohei Nakajima 发推分享了一种快得足以用于实时情感检测的技术,强调其性能为实时。

0 人收藏 0 人点赞
#real-time

@0xCheshire: Jev 是目前最佳的 System 1 决策模型之一,这是毋庸置疑的。但它有一个致命缺陷:它不是…

X AI KOLs Timeline ↗ · 2026-09-22 缓存

这篇帖子比较了 AI 模型 Jev 和 Laya,突出了 Laya 在实时游戏决策中的开源、本地和低延迟能力。

0 人收藏 0 人点赞
#real-time

避免时间触发通信系统中的胡言乱语故障

Hacker News Top ↗ · 2026-09-21

本文探讨了在时间触发通信系统中预防胡言乱语故障的方法,以增强系统的可靠性与安全性。

0 人收藏 0 人点赞
#real-time

@_marcus_ng: 我和@jam__cai赢得了$10k现金,并在@HackTheNorth成为半决赛选手,构建了adlib,这是展示新想法的最佳方式。总是…

X AI KOLs Following ↗ · 2026-09-21 缓存

Marcus Ng和Jamie Cai通过构建Adlib赢得了$10k并成为HackTheNorth的半决赛选手。Adlib是一个工具,可以从口语实时创建流程图、图表和图形,以替代传统的幻灯片。

0 人收藏 0 人点赞
#real-time

@svpino: 这个新模型做了一件很酷的事:它能在你说话时将语音转换为文本。这与其他所有a…

X AI KOLs Timeline ↗ · 2026-09-20 缓存

R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈