@FeitengLi: 由 Fable 5 领衔(仅半天)Codex 接力开发历时一周 #EdgeSpeak 正式上线,转发的朋友联系我收邀请码 https://edgespeak.com/zh

X AI KOLs Timeline 产品

摘要

EdgeSpeak 桌面端语音转录工具正式上线,搭载本地 Lattice-2 语音大模型,支持离线音视频转录、多种语言和口音,并提供本地 API 接口以便开发者集成。

由 Fable 5 领衔(仅半天)Codex 接力开发历时一周 #EdgeSpeak 正式上线,转发的朋友联系我收邀请码 https://t.co/HquVtvEK9n https://t.co/stsA7xYV9D
查看原文
查看缓存全文

缓存时间: 2026/06/22 01:41

由 Fable 5 领衔(仅半天)Codex 接力开发历时一周 #EdgeSpeak 正式上线,转发的朋友联系我收邀请码

https://t.co/HquVtvEK9n https://t.co/stsA7xYV9D


把语音 AI 大模型放进你的电脑 | EdgeSpeak

Source: https://edgespeak.com/zh 设备端语音引擎

EdgeSpeak 将专业语音模型经优化压缩放进桌面端。支持会议、访谈、视频,或新建录音在本机完成转录;音视频、转录文稿留在你的设备内。

让电脑自己听懂会议、访谈和视频。

local-transcribe.mov

00:04拖入会议、访谈、视频,或新建录音。

00:12Lattice-2 在本机写出文稿,边跑边看。

00:27校对后导出,或交给别的工具继续用。

专属端侧大模型

Lattice-2:专为桌面端侧深度调优的语音大模型

Lattice-2 是 EdgeSpeak 搭载的本地语音模型系列,经过压缩、推理优化和本地算力适配,让普通个人电脑也能处理会议、访谈、视频和录音。

端侧压缩与推理适配

把语音 AI 大模型调成适合桌面端运行的形态,减少等待,本地转录不依赖外部服务。

Flash / Pro 双模型协同

Flash 面向日常会议和视频转录,响应更快;Pro 面向更难音频、更复杂口音和更高准确率需求,会多占一点本机资源。

融入开发者工作流

支持 40 多种语言、多种英语口音和汉语方言;同一颗本地引擎也能通过网关交给 CLI、Agent 和自动化流程。

真实桌面端

Lattice-2,已经在 EdgeSpeak 桌面端里跑起来

当前桌面端:导入音频或视频,选择 Lattice-2 模型,导出结果;需要自动化时可以通过语音网关能力和 Agent 高效协作。

音频、视频和文稿在一个工作台里播放、时间线、文稿、导出、最近文件和当前 Lattice 模型都在一起。少切一次工具,少丢一次上下文。EdgeSpeak 桌面端转录主界面,展示主转录工作台、本地 Lattice 模型状态、文稿内容、播放控制和最近文件。

按任务选择 Lattice 模型Lattice-2 支持 40 多种语言、多种英语口音和汉语方言。Flash 速度快、效果好;Pro 更准,也会多占一点本机资源。EdgeSpeak 桌面端模型页面,展示本地 Lattice-2 Flash 和 Lattice-2 Pro 选项。

让别的工具也用 Lattice命令行、Agent 和自动化流程都可以把音频交给 EdgeSpeak,再从 Lattice 拿回转好的文稿。EdgeSpeak 桌面端网关页面,展示同一台电脑上的其他工具如何使用本机语音引擎。

早鸟

早鸟 $29,把 Lattice 放进你的工作流

当前版本已经能用 Lattice-2 完成本机音视频转录,也能通过本地网关接入 CLI、Agent 和自动化流程。终身授权包含后续模型和语音能力更新:先买当前能用的东西,再一起等它长大。

早鸟价

终身授权

**29**99一次付费

当前 $29,正式价 $99。

  • 本机音视频转录已可用
  • 本地网关和 CLI 已可用
  • 后续模型和语音能力更新
  • 最多 4 台设备

如需更多设备或团队购买:[email protected]

本地语音网关

让 Agent 和自动化工具,直接调用这台电脑里的 Lattice-2

EdgeSpeak 把 Lattice-2 封装成同一台电脑上的本地语音 API。CLI、Agent、自动化脚本和兼容 OpenAI 转录接口的工具,都可以把音频交给本地引擎,再拿回转录文稿。它不是另一朵云,是你电脑里的语音网关。

本地 OpenAI 兼容接口CLI / Agent / 自动化Lattice-2 Flash 和 Pro

edgespeak gateway - 127.0.0.1:1117

curl http://127.0.0.1:1117/v1/audio/transcriptions \
  -H "Authorization: Bearer sk-edgespeak-..." \
  -F [email protected] \
  -F model="lattice-2-flash"

Feiteng (@FeitengLi): 收藏破千,看来推友苦识别不准幻觉、时间轴不准久矣。

识别准 + 时间轴稳 + 说话人标记,全做好的寥寥。

要么我练手来写个桌面软件:内存 1G 左右,M4 上 40 倍实时率(1 分钟识别 40 分钟音频)。

桌面 App:拖拽文件转写、直接识别麦克风、会议纪要 兼容 OpenAI Audio API、可以接管 OpenClaw

相似文章

@leeoxiang: 太需要一个精准的时间戳对齐服务了

X AI KOLs Following

Feiteng Li 宣布发布 EdgeSpeak,一个本地优先、隐私无泄漏的精准转录服务,支持拖拽音视频或麦克风录音转写、语义分段、字词级时间戳,并可导出 JSON/SRT/MD,兼容 OpenAI Audio API、CLI、SKILL 和 MCP 工作流。

@uniswap12: 微软开源了一个语音 AI,60 分钟长音频一次转写,4 个人同时说话都能搞定 VibeVoice,微软开源,24.8k star,今天才知道这个。录音一键转文字这件事,我之前一直用 Whisper,但它处理长会议录音经常超时,多人说话识别…

X AI KOLs Timeline

微软开源了语音AI框架VibeVoice,支持60分钟长音频一次性转写、多说话人分离和时间戳标注,同时提供多角色TTS合成能力,底层基于Qwen2.5并配有0.5B轻量实时版本,已在GitHub获得24.8k星标。