AudioNotes:本地音视频转结构化笔记
开源音视频笔记工具:FunASR 在本地完成语音识别,Ollama 本地模型把文字稿整理成结构化 Markdown,数据不出本机,适合整理会议、访谈和课程录音。
项目资料
GitHub Ecosystem- 许可证
- MIT
- 主语言
- Python
- 星标
- 2,515
- 核查时间
- 2026-09-25
以上快照资料以核查当日为准,可能随版本或运营策略变化。
把一段会议录音整理成文字,往往得反复回听。AudioNotes 把这件事搬到了本机:上传音频、视频或直接在浏览器录音,FunASR 先在本地识别出文字稿,Ollama 跑的本地大模型再把它整理成一份 Markdown 笔记。GitHubDaily 在 2025 年 2 月推荐过它。
核心功能
- 音视频转文字稿:上传文件即可转写,也支持浏览器录音;首次需联网下载约 2.15GB 语音模型。
- 笔记与问答:识别结果由大模型整理成结构化 Markdown,可继续追问负责人、时间、结论,历史对话保留。
- 热词与说话人分离:领域热词可提升准确率;.env 开启说话人分离后可生成带说话人标签的 SRT 字幕。
- 本地优先:识别与问答全程在本机完成,默认不调用第三方 AI,Web 服务默认仅本机可访问。
典型使用场景
- 会议整理:录音转成笔记后,直接追问谁负责、何时完成、定了什么。
- 访谈与播客归档:记者、研究者把素材转成可检索的 Markdown 存档。
- 课程复习:把课程视频、语音备忘录转成文字稿,方便快速回看。
快速上手
先安装并启动 Docker Desktop 与 Ollama,在空目录执行:
ollama pull qwen3.5:2b
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/docker-compose.yml -o docker-compose.yml
curl -fsSL https://github.com/harry0703/AudioNotes/raw/main/.env.example -o .env
docker compose up -d --remove-orphans
启动后访问 http://localhost:15433/,默认账号密码均为 admin。默认镜像仅用 CPU 即可运行;Linux 上若有 NVIDIA 显卡,可按仓库说明用 docker-compose.gpu.yml 开启 GPU 加速。
小结
适合常整理会议、访谈、课程录音,又不愿把内容交给云端 AI 的用户,默认模型组合对中文识别较友好,问答由本地 Ollama 完成,无需申请第三方 AI 服务的 API Key。项目采用 MIT 许可证,仍在维护,最近一次更新在 2026 年 8 月。注意:首次使用需联网下载镜像与模型;Docker 建议内存 12GB 起,长音视频最好 16GB,磁盘预留 10GB 左右;共用设备应修改 .env 中的账号密码;识别质量受录音噪声、口音和多人同时发言的影响。