AudioNotes 是一款本地运行的音视频转文字和智能笔记工具,适合整理会议、访谈、课程和语音备忘录。
主要功能:
- 上传音频或视频,自动生成文字稿。
- 将识别结果整理为清晰的 Markdown 笔记。
- 根据音视频内容继续提问。
- 支持浏览器录音、领域热词和对话历史。
AudioNotes 默认在你的电脑上完成语音识别、笔记整理和内容问答:
- 音视频、文字稿、笔记和对话历史保存在本机。
- FunASR 在本地识别语音,Ollama 在本地运行大语言模型。
- 默认不把音视频内容发送给第三方 AI 接口。
- Web 页面默认只允许本机访问,不对局域网或互联网开放。
首次安装仍需要联网下载应用镜像和模型,但处理个人内容时不依赖云端 AI 服务。请在受信任的电脑上使用,并妥善保护本机账户和磁盘数据。
开始前请安装并启动:
建议为 Docker Desktop 分配至少 12GB 内存;处理较长音视频时推荐 16GB,并预留约 10GB 磁盘空间。
ollama pull qwen3.5:2bmkdir audionotes
cd audionotes
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/docker-compose.yml -o docker-compose.yml
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/.env.example -o .env
docker compose up -d --remove-orphans访问 http://localhost:15433/,默认账号和密码均为 admin。
首次识别会自动下载约 2.15GB 的语音模型,等待时间取决于网络速度。模型下载完成后会保存在本机,后续无需重复下载。
如果希望直接运行源码,请先准备 Python 3.12、ffmpeg 和 Ollama。AudioNotes 会自动创建本地数据文件,不需要安装或配置数据库服务。
git clone https://github.com/harry0703/AudioNotes.git
cd AudioNotes
python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install -r requirements.txt
cp .env.example .env
ollama pull qwen3.5:2b确认 Ollama 已启动后运行:
python -m chainlit run main.py --host 127.0.0.1 --port 15433同样访问 http://localhost:15433/。退出虚拟环境可以执行 deactivate。
- 登录后上传音频或视频,也可以直接使用浏览器录音。
- 等待语音识别和笔记整理完成。
- 查看完整文字稿和结构化笔记。
- 在输入框中继续询问负责人、时间、结论或其他内容。
- 从左侧历史记录重新打开以前的笔记。
- 语音识别:
FunAudioLLM/Fun-ASR-Nano-2512 - 笔记整理与问答:
qwen3.5:2b
默认组合优先兼顾中文识别质量和普通电脑的资源占用。识别结果仍可能受到录音质量、环境噪声、口音和多人重叠说话影响,重要内容请结合原音频核对。
如需识别更多语言,打开 .env,将 ASR_MODEL 改为 FunAudioLLM/Fun-ASR-MLT-Nano-2512,然后重新启动服务。默认模型不会自动改变,当前页面也不会在运行期间切换模型。
使用 Docker 时,上传文件、FunASR 模型缓存、日志和对话历史都保存在创建的 audionotes 文件夹中。使用源码时,个人数据保存在项目的 storage 文件夹中,FunASR 模型保存在本机模型缓存中。Ollama 模型由 Ollama 单独管理。
- 备份:停止服务后复制整个
audionotes文件夹。 - 迁移:将整个文件夹复制到新电脑,安装 Docker 和 Ollama、拉取默认模型后再启动服务。
- 清理:确认不再需要历史数据后,停止服务并删除该文件夹。
使用 Docker 时,停止或重新启动:
docker compose down
docker compose up -d使用 Docker 时,更新到最新版本:
docker compose pull
docker compose up -d --remove-orphansDocker 方式页面无法打开时,先确认 Docker Desktop 和 Ollama 均已启动,然后检查服务状态:
docker compose ps
docker compose logs -f webui源码方式无法启动时,请先查看终端中的错误信息,并确认 Python 版本、ffmpeg 和 Ollama 均可正常使用。
如果提示找不到模型,重新执行:
ollama pull qwen3.5:2b如果处理长音频时页面中断或服务重启,请增加 Docker Desktop 的内存配额。实测 8GB 可能不足,推荐使用 16GB。
如果电脑由多人共用,请打开 .env 文件并修改 USERNAME 和 PASSWORD,然后重新启动服务。
Linux 电脑如配有 NVIDIA 显卡,并且已经安装 NVIDIA 驱动和 Container Toolkit,可以使用可选配置启用 GPU 识别加速:
git clone https://github.com/harry0703/AudioNotes.git
cd AudioNotes
cp .env.example .env
docker compose -f docker-compose.yml -f docker-compose.gpu.yml up -d --build默认快速体验仍使用 CPU 镜像,不需要 NVIDIA 显卡。首次构建 GPU 镜像需要下载较大的 CUDA 依赖。

