@FeitengLi: 由 Fable 5 领衔(仅半天)Codex 接力开发历时一周 #EdgeSpeak 正式上线,转发的朋友联系我收邀请码 https://edgespeak.com/zh
摘要
EdgeSpeak 桌面端语音转录工具正式上线,搭载本地 Lattice-2 语音大模型,支持离线音视频转录、多种语言和口音,并提供本地 API 接口以便开发者集成。
查看缓存全文
缓存时间: 2026/06/22 01:41
由 Fable 5 领衔(仅半天)Codex 接力开发历时一周 #EdgeSpeak 正式上线,转发的朋友联系我收邀请码
https://t.co/HquVtvEK9n https://t.co/stsA7xYV9D
把语音 AI 大模型放进你的电脑 | EdgeSpeak
Source: https://edgespeak.com/zh 设备端语音引擎
EdgeSpeak 将专业语音模型经优化压缩放进桌面端。支持会议、访谈、视频,或新建录音在本机完成转录;音视频、转录文稿留在你的设备内。
让电脑自己听懂会议、访谈和视频。
local-transcribe.mov
00:04拖入会议、访谈、视频,或新建录音。
00:12Lattice-2 在本机写出文稿,边跑边看。
00:27校对后导出,或交给别的工具继续用。
专属端侧大模型
Lattice-2:专为桌面端侧深度调优的语音大模型
Lattice-2 是 EdgeSpeak 搭载的本地语音模型系列,经过压缩、推理优化和本地算力适配,让普通个人电脑也能处理会议、访谈、视频和录音。
端侧压缩与推理适配
把语音 AI 大模型调成适合桌面端运行的形态,减少等待,本地转录不依赖外部服务。
Flash / Pro 双模型协同
Flash 面向日常会议和视频转录,响应更快;Pro 面向更难音频、更复杂口音和更高准确率需求,会多占一点本机资源。
融入开发者工作流
支持 40 多种语言、多种英语口音和汉语方言;同一颗本地引擎也能通过网关交给 CLI、Agent 和自动化流程。
真实桌面端
Lattice-2,已经在 EdgeSpeak 桌面端里跑起来
当前桌面端:导入音频或视频,选择 Lattice-2 模型,导出结果;需要自动化时可以通过语音网关能力和 Agent 高效协作。
音频、视频和文稿在一个工作台里播放、时间线、文稿、导出、最近文件和当前 Lattice 模型都在一起。少切一次工具,少丢一次上下文。
按任务选择 Lattice 模型Lattice-2 支持 40 多种语言、多种英语口音和汉语方言。Flash 速度快、效果好;Pro 更准,也会多占一点本机资源。
让别的工具也用 Lattice命令行、Agent 和自动化流程都可以把音频交给 EdgeSpeak,再从 Lattice 拿回转好的文稿。
早鸟
早鸟 $29,把 Lattice 放进你的工作流
当前版本已经能用 Lattice-2 完成本机音视频转录,也能通过本地网关接入 CLI、Agent 和自动化流程。终身授权包含后续模型和语音能力更新:先买当前能用的东西,再一起等它长大。
早鸟价
终身授权
**29**99一次付费
当前 $29,正式价 $99。
- 本机音视频转录已可用
- 本地网关和 CLI 已可用
- 后续模型和语音能力更新
- 最多 4 台设备
如需更多设备或团队购买:[email protected]
本地语音网关
让 Agent 和自动化工具,直接调用这台电脑里的 Lattice-2
EdgeSpeak 把 Lattice-2 封装成同一台电脑上的本地语音 API。CLI、Agent、自动化脚本和兼容 OpenAI 转录接口的工具,都可以把音频交给本地引擎,再拿回转录文稿。它不是另一朵云,是你电脑里的语音网关。
本地 OpenAI 兼容接口CLI / Agent / 自动化Lattice-2 Flash 和 Pro
edgespeak gateway - 127.0.0.1:1117
curl http://127.0.0.1:1117/v1/audio/transcriptions \
-H "Authorization: Bearer sk-edgespeak-..." \
-F [email protected] \
-F model="lattice-2-flash"
Feiteng (@FeitengLi): 收藏破千,看来推友苦识别不准幻觉、时间轴不准久矣。
识别准 + 时间轴稳 + 说话人标记,全做好的寥寥。
要么我练手来写个桌面软件:内存 1G 左右,M4 上 40 倍实时率(1 分钟识别 40 分钟音频)。
桌面 App:拖拽文件转写、直接识别麦克风、会议纪要 兼容 OpenAI Audio API、可以接管 OpenClaw
相似文章
@FeitengLi: 下周把说话人标记和语音生成加上 就不是这个便宜的早鸟价了
EdgeSpeak 正式发布,一款本地优先、保护隐私的精准转录工具,支持语义分段和时间戳,兼容 OpenAI Audio API 等,后续将增加说话人标记和语音生成功能。
@leeoxiang: 太需要一个精准的时间戳对齐服务了
Feiteng Li 宣布发布 EdgeSpeak,一个本地优先、隐私无泄漏的精准转录服务,支持拖拽音视频或麦克风录音转写、语义分段、字词级时间戳,并可导出 JSON/SRT/MD,兼容 OpenAI Audio API、CLI、SKILL 和 MCP 工作流。
@uniswap12: 微软开源了一个语音 AI,60 分钟长音频一次转写,4 个人同时说话都能搞定 VibeVoice,微软开源,24.8k star,今天才知道这个。录音一键转文字这件事,我之前一直用 Whisper,但它处理长会议录音经常超时,多人说话识别…
微软开源了语音AI框架VibeVoice,支持60分钟长音频一次性转写、多说话人分离和时间戳标注,同时提供多角色TTS合成能力,底层基于Qwen2.5并配有0.5B轻量实时版本,已在GitHub获得24.8k星标。
@cevenif: 兄弟们,那些还得掏钱才能用的语音工具,是时候跟它们说88了! 开源免费的 Voicebox 已经杀出来了,直接把 ElevenLabs 和 WisprFlow 这两家付费巨头按在地上摩擦。 功能: 声音克隆,秒变任何人 全局语音输入,随时…
一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。
@iluciddreaming: Google 又干掉了一个创业公司…… Google AI Edge Eloquent 现已支持 Mac,完全本地的 Wispr Flow 替代品。 基于最新 Gemma 模型,支持实时语音转录 + 语音命令编辑文本。 免费、无订阅、无需…
Google AI Edge Eloquent 现已支持 Mac,作为完全本地的 Wispr Flow 替代品,基于最新 Gemma 模型实现实时语音转录和语音命令编辑文本,免费、无订阅且隐私全本地。