@leeoxiang: 太需要一个精准的时间戳对齐服务了
摘要
Feiteng Li 宣布发布 EdgeSpeak,一个本地优先、隐私无泄漏的精准转录服务,支持拖拽音视频或麦克风录音转写、语义分段、字词级时间戳,并可导出 JSON/SRT/MD,兼容 OpenAI Audio API、CLI、SKILL 和 MCP 工作流。
查看缓存全文
缓存时间: 2026/07/02 16:26
太需要一个精准的时间戳对齐服务了 👍
Feiteng (@FeitengLi): 今天 EdgeSpeak 正式发布:本地优先、隐私无泄漏、精准转录
拖拽音视频 / 麦克风录音即可转写: > 支持语义分段、字词级时间戳、导出 JSON / SRT / MD > 兼容 OpenAI Audio API、CLI、SKILL 和 MCP 工作流。
EdgeSpeak 由 Fable5 有始有终开发完成,
相似文章
@FeitengLi: 下周把说话人标记和语音生成加上 就不是这个便宜的早鸟价了
EdgeSpeak 正式发布,一款本地优先、保护隐私的精准转录工具,支持语义分段和时间戳,兼容 OpenAI Audio API 等,后续将增加说话人标记和语音生成功能。
@FeitengLi: 由 Fable 5 领衔(仅半天)Codex 接力开发历时一周 #EdgeSpeak 正式上线,转发的朋友联系我收邀请码 https://edgespeak.com/zh
EdgeSpeak 桌面端语音转录工具正式上线,搭载本地 Lattice-2 语音大模型,支持离线音视频转录、多种语言和口音,并提供本地 API 接口以便开发者集成。
@mogician301: https://x.com/mogician301/status/2072250774332285073
介绍了一个名为 audio-to-text 的开源工具,它利用 AI 和本地工具(如 faster-whisper 和 ffmpeg)帮助用户自动生成、校对和烧录字幕,解决剪映等软件成本高、错误多、流程繁琐的问题。
@uniswap12: 微软开源了一个语音 AI,60 分钟长音频一次转写,4 个人同时说话都能搞定 VibeVoice,微软开源,24.8k star,今天才知道这个。录音一键转文字这件事,我之前一直用 Whisper,但它处理长会议录音经常超时,多人说话识别…
微软开源了语音AI框架VibeVoice,支持60分钟长音频一次性转写、多说话人分离和时间戳标注,同时提供多角色TTS合成能力,底层基于Qwen2.5并配有0.5B轻量实时版本,已在GitHub获得24.8k星标。
@Huahuazo: 做海外视频搬运最烦什么?字幕切割靠手调、翻译对齐靠眼盯、音轨同步靠感觉——这套流程走下来,效率低得让人想摔键盘。 VideoLingo这套工具把整个流程串成了一条自动化流水线,目前GitHub 7k+ Star,MIT协议,用着也踏实。 …
VideoLingo 是一个开源视频翻译、本地化与配音工具,利用 WhisperX 和 AI 实现 Netflix 级字幕与多语言配音,支持 yt-dlp 下载和多种 TTS,帮助视频搬运者自动化处理全流程。