标签
WhisperLive 是一个开源实时转录工具,使用OpenAI的Whisper,支持多种后端(如faster-whisper和TensorRT)用于实时语音转文字。
TurboOCR v3 是一款自托管的高速OCR服务器,在RTX 5090上使用PP-OCRv6模型实现约每秒520张图片的处理速度,并新增了表格和公式的结构化解析功能。
本教程来自NVIDIA,介绍了将FP8量化PyTorch模型转换为TensorRT推理引擎用于生产部署的端到端工作流程,涵盖ONNX导出和性能分析。
DEMON 提出了一种实时扩散引擎,通过控制去噪过程实现现场音乐演奏,在单块 RTX 5090 上每秒可完成多达 12.3 次解码器推理。它引入了异构调度、共享可变状态、逐帧混合和窗口化 VAE 解码,以实现响应式控制。
NVIDIA 正式发布了一套用于 AI 代理的技能集,涵盖视频分析、语音代理、LLM 训练、模型加速、RAG、安全环境、物流优化和 CUDA 编程。