我一直在研究的一种视听技术 - [并已开源]
摘要
作者一直在研究一种视听技术,并将其开源。
暂无内容
相似文章
我开源了多语言教育视频生成器背后的系统
作者开源了 SarasFlow,这是一个 AI 流水线,能够根据主题生成教育视频:编写脚本、生成旁白、制作视觉内容、添加字幕并组装最终视频,所有组件都是模块化且可替换的。
@yusuke_post: 我已发布源代码。https://github.com/shure-dev/small_vlm_video_analysis… 机制很简单:・预先…
该文章宣布开源发布 small_vlm_video_analysis,这是一个使用本地小型视觉语言模型的工具,用于验证程序化视频是否符合预定义的 SOP,包括帧描述、基于规则的判断以及可视化工具。
开源:将声音模仿转化为音效(声音生成的新用户体验)
一个开源AI模型,通过声音模仿和文字描述生成音效,解决了搜索特定声音的难题。
开源我一直在构建的 AI 视频平台:SARAS
作者开源了 SARAS,一个 AI 视频平台,能从简单主题生成完整视频(脚本、配音、画面、剪辑、字幕),支持 24 种语言和多种风格,包含后端功能如认证、支付和 270+ 测试。
我训练了一个音频模型,能生成用于音乐制作的无限单次音效,并将文本提示转化为完全可演奏的合成器。我不仅发布了模型,还发布了一个视频,详细展示了如何实现这一点(以及让其他人制作基于文本合成器的推理流程)。
一位独立音频研究员训练了名为 Foundation-1 的模型,该模型能生成用于音乐制作的无限单次音效,并将文本提示转化为可演奏的合成器,同时发布了模型、相关文档和推理工具。