@Ryrenz: 真香,把录音丢进去直接出笔记,全程不联网 GitHub 上 2.2K stars 听两小时的播客或者网课,真正想留下的可能就那几段。手动记要暂停回放,用在线转写工具又得把音频传上去,涉及公司会议或者私人内容时就不太敢用。 AudioNot…
摘要
AudioNotes 是一款本地运行的音视频转文字和智能笔记工具,强调隐私保护和离线使用,支持通过 Docker 或 Python 部署。
查看缓存全文
缓存时间: 2026/08/21 11:09
真香,把录音丢进去直接出笔记,全程不联网
GitHub 上 2.2K stars
听两小时的播客或者网课,真正想留下的可能就那几段。手动记要暂停回放,用在线转写工具又得把音频传上去,涉及公司会议或者私人内容时就不太敢用。
AudioNotes 整套跑在本机。上传音频或视频,它先出文字稿,再整理成 Markdown 笔记,之后还能就着内容直接提问,对话历史也存着。浏览器录音、领域热词这些都支持,专业名词转错的问题能靠热词修掉。
之所以能全本地,是因为语音识别用 FunASR,语言模型走 Ollama,默认配置是 FunAudioLLM/Fun-ASR-Nano-2512 加 qwen3.5:2b。音视频、文字稿、笔记和对话历史默认全部留在本机,网页服务也只监听本地地址。
部署给了 Docker 和 Python 3.12 源码两条路,默认端口 15433,Docker 版初始账号密码都是 admin,装完记得先改。首次使用需要联网下载镜像和模型,语音模型约 2.15GB。
能本地跑的工具,才敢拿来处理真正重要的东西。
GitHub:
harry0703/AudioNotes
Source: https://github.com/harry0703/AudioNotes
AudioNotes
AudioNotes 是一款本地运行的音视频转文字和智能笔记工具,适合整理会议、访谈、课程和语音备忘录。
主要功能:
- 上传音频或视频,自动生成文字稿。
- 将识别结果整理为清晰的 Markdown 笔记。
- 根据音视频内容继续提问。
- 支持浏览器录音、领域热词和对话历史。
本地优先与隐私
AudioNotes 默认在你的电脑上完成语音识别、笔记整理和内容问答:
- 音视频、文字稿、笔记和对话历史保存在本机。
- FunASR 在本地识别语音,Ollama 在本地运行大语言模型。
- 默认不把音视频内容发送给第三方 AI 接口。
- Web 页面默认只允许本机访问,不对局域网或互联网开放。
首次安装仍需要联网下载应用镜像和模型,但处理个人内容时不依赖云端 AI 服务。请在受信任的电脑上使用,并妥善保护本机账户和磁盘数据。
效果展示
音视频识别和整理

与音视频内容对话

Docker 快速体验
开始前请安装并启动:
建议为 Docker Desktop 分配至少 12GB 内存;处理较长音视频时推荐 16GB,并预留约 10GB 磁盘空间。
1. 准备本地模型
ollama pull qwen3.5:2b
2. 下载并启动 AudioNotes
mkdir audionotes
cd audionotes
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/docker-compose.yml -o docker-compose.yml
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/.env.example -o .env
docker compose up -d --remove-orphans
3. 打开页面
访问 http://localhost:15433/,默认账号和密码均为 admin。
首次识别会自动下载约 2.15GB 的语音模型,等待时间取决于网络速度。模型下载完成后会保存在本机,后续无需重复下载。
从源码启动(可选)
如果希望直接运行源码,请先准备 Python 3.12、ffmpeg 和 Ollama。AudioNotes 会自动创建本地数据文件,不需要安装或配置数据库服务。
git clone https://github.com/harry0703/AudioNotes.git
cd AudioNotes
python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install -r requirements.txt
cp .env.example .env
ollama pull qwen3.5:2b
确认 Ollama 已启动后运行:
python -m chainlit run main.py --host 127.0.0.1 --port 15433
同样访问 http://localhost:15433/。退出虚拟环境可以执行 deactivate。
使用方法
- 登录后上传音频或视频,也可以直接使用浏览器录音。
- 等待语音识别和笔记整理完成。
- 查看完整文字稿和结构化笔记。
- 在输入框中继续询问负责人、时间、结论或其他内容。
- 从左侧历史记录重新打开以前的笔记。
默认模型
- 语音识别:
FunAudioLLM/Fun-ASR-Nano-2512 - 笔记整理与问答:
qwen3.5:2b
默认组合优先兼顾中文识别质量和普通电脑的资源占用。识别结果仍可能受到录音质量、环境噪声、口音和多人重叠说话影响,重要内容请结合原音频核对。
如需识别更多语言,打开 .env,将 ASR_MODEL 改为 FunAudioLLM/Fun-ASR-MLT-Nano-2512,然后重新启动服务。默认模型不会自动改变,当前页面也不会在运行期间切换模型。
数据管理
使用 Docker 时,上传文件、FunASR 模型缓存、日志和对话历史都保存在创建的 audionotes 文件夹中。使用源码时,个人数据保存在项目的 storage 文件夹中,FunASR 模型保存在本机模型缓存中。Ollama 模型由 Ollama 单独管理。
- 备份:停止服务后复制整个
audionotes文件夹。 - 迁移:将整个文件夹复制到新电脑,安装 Docker 和 Ollama、拉取默认模型后再启动服务。
- 清理:确认不再需要历史数据后,停止服务并删除该文件夹。
使用 Docker 时,停止或重新启动:
docker compose down
docker compose up -d
使用 Docker 时,更新到最新版本:
docker compose pull
docker compose up -d --remove-orphans
常见问题
Docker 方式页面无法打开时,先确认 Docker Desktop 和 Ollama 均已启动,然后检查服务状态:
docker compose ps
docker compose logs -f webui
源码方式无法启动时,请先查看终端中的错误信息,并确认 Python 版本、ffmpeg 和 Ollama 均可正常使用。
如果提示找不到模型,重新执行:
ollama pull qwen3.5:2b
如果处理长音频时页面中断或服务重启,请增加 Docker Desktop 的内存配额。实测 8GB 可能不足,推荐使用 16GB。
如果电脑由多人共用,请打开 .env 文件并修改 USERNAME 和 PASSWORD,然后重新启动服务。
Linux 电脑如配有 NVIDIA 显卡,并且已经安装 NVIDIA 驱动和 Container Toolkit,可以使用可选配置启用 GPU 识别加速:
git clone https://github.com/harry0703/AudioNotes.git
cd AudioNotes
cp .env.example .env
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d --build
默认快速体验仍使用 CPU 镜像,不需要 NVIDIA 显卡。首次构建 GPU 镜像需要下载较大的 CUDA 依赖。
相似文章
@DanKornas:会议记录不应强制将你的音频和转录内容上传到别人的云端。anarlog(原名 Hyprnote)是一款本…
anarlog(原名 Hyprnote)是一款开源、本地优先的 AI 会议记录工具,可在本地转录并将会议内容保存为 Markdown 文件,支持多种 AI 提供商和灵活的同步选项。
@GitHub_Daily: GitHub 上一款专为 Mac 打造的纯本地语音转文字开源工具:MacParakeet,识别准确率颇高。 支持直接拖拽音视频文件,或者贴个 YouTube 链接,就能快速输出带时间戳和说话人标签的文稿。 还能同时录制电脑系统声音和麦克风…
MacParakeet is a new open-source Mac application that provides fast, fully local voice transcription using Apple's Neural Engine and NVIDIA's Parakeet model, ensuring privacy by keeping audio data on-device.
joeseesun/qiaomu-anything-to-notebooklm
一个开源工具,利用Claude Code Skill和Google NotebookLM将多种来源的内容(网页、PDF、音频、视频等)转换为播客、PPT、思维导图等格式,并内置付费墙绕过功能。
@Ryrenz: 太强了,能把整本电子书变成有声书,还能用你自己的声音念 GitHub 上 1.97 万 stars 通勤路上想「读」完一本书,现有办法都别扭:有声书平台上没有你想听的那本,机器朗读又是那种一听就想关掉的电子腔,中文里还经常读错停顿。 这个…
这个项目可以将电子书转换为有声书,支持多种格式和TTS引擎,包括语音克隆,适用于通勤时听书。
@mogician301: https://x.com/mogician301/status/2072250774332285073
介绍了一个名为 audio-to-text 的开源工具,它利用 AI 和本地工具(如 faster-whisper 和 ffmpeg)帮助用户自动生成、校对和烧录字幕,解决剪映等软件成本高、错误多、流程繁琐的问题。