我一直在研究的一种视听技术 - [并已开源]

Reddit r/artificial 工具

摘要

作者一直在研究一种视听技术,并将其开源。

暂无内容
查看原文

相似文章

我开源了多语言教育视频生成器背后的系统

Reddit r/AI_Agents

作者开源了 SarasFlow,这是一个 AI 流水线,能够根据主题生成教育视频:编写脚本、生成旁白、制作视觉内容、添加字幕并组装最终视频,所有组件都是模块化且可替换的。

开源我一直在构建的 AI 视频平台:SARAS

Reddit r/AI_Agents

作者开源了 SARAS,一个 AI 视频平台,能从简单主题生成完整视频(脚本、配音、画面、剪辑、字幕),支持 24 种语言和多种风格,包含后端功能如认证、支付和 270+ 测试。

我训练了一个音频模型,能生成用于音乐制作的无限单次音效,并将文本提示转化为完全可演奏的合成器。我不仅发布了模型,还发布了一个视频,详细展示了如何实现这一点(以及让其他人制作基于文本合成器的推理流程)。

Reddit r/LocalLLaMA

一位独立音频研究员训练了名为 Foundation-1 的模型,该模型能生成用于音乐制作的无限单次音效,并将文本提示转化为可演奏的合成器,同时发布了模型、相关文档和推理工具。