AI-Video-Transcriber | 开源转录工具 – 视频播客摘要 – Docker可部署

简介

AI-Video-Transcriber 是一个面向视频、播客、课程、访谈和会议录音整理场景的开源 AI 转录工具,支持从公开视频链接或本地音视频文件生成文字稿,并进一步做文本优化、翻译和摘要。杂货喵小编根据 WarpNav 源文、GitHub 仓库、README 和项目说明整理,以本文介绍它的功能定位、部署方式、适用场景、隐私边界和使用注意事项。

项目由 wendy7756 维护,主要使用 Python 开发,仓库采用 Apache-2.0 许可。它把 yt-dlp、FFmpeg、Faster-Whisper、FastAPI 和 OpenAI 兼容接口组合成一个可自部署的网页应用,适合想把长视频、播客或课程内容整理成可搜索、可编辑 Markdown 文档的用户。需要注意的是,它不是零配置在线 SaaS,部署前仍要准备 Python、FFmpeg、API Key 或可用的 OpenAI 兼容模型服务。

AI-Video-Transcriber | 开源转录工具 - 视频播客摘要 - Docker可部署

本文要点

  • 支持 YouTube、TikTok、Bilibili、Apple Podcasts、SoundCloud 等 yt-dlp 可处理的平台链接,也支持本地文件上传。
  • 支持 .txt、.mp3、.mp4、.m4a、.wav、.webm、.mkv、.ogg、.flac 等输入格式,其中 .txt 会跳过 Whisper 直接进入文本处理流程。
  • 项目采用“字幕优先”思路:有平台字幕时优先提取字幕,没有字幕时再回退到 Faster-Whisper 转录。
  • 可在 UI 中配置 OpenAI、OpenRouter、本地 LLM 等 OpenAI 兼容接口,用于文本优化、翻译和摘要。
  • 支持 install.sh、本地 Python 虚拟环境、Docker 和 Docker Compose 部署;长视频建议使用生产模式启动。

相关链接

  • GitHub 仓库:https://github.com/wendy7756/AI-Video-Transcriber
  • 项目主页:https://sipsip.ai
  • WarpNav 源文:https://warpnav.com/ai-video-transcriber-github
  • yt-dlp:https://github.com/yt-dlp/yt-dlp
  • Faster-Whisper:https://github.com/guillaumekln/faster-whisper

核心功能说明

多平台链接与本地文件输入

AI-Video-Transcriber 可以处理视频、播客 URL,也可以上传本地音频、视频或纯文本文件。公开视频链接主要依赖 yt-dlp 支持的平台范围,本地媒体文件则通过 FFmpeg 做格式归一化后交给 Whisper 流程处理。对内容整理者来说,这意味着同一套界面可以覆盖公开视频、播客音频、会议录音、课程文件和已有文字稿。

字幕优先与 Faster-Whisper 兜底

项目的一个实用设计是字幕优先。对于已有原生字幕的平台内容,工具会优先提取字幕文本,不必每次下载音频再做语音识别;没有字幕时,再使用 Faster-Whisper 进行转录。这个逻辑适合批量整理 YouTube 课程、公开视频和已有字幕的节目,也能在无字幕内容上保留转录能力。

AI 优化、翻译与摘要

转录完成后,AI-Video-Transcriber 可以对文本做错字修正、句子补全、段落整理和摘要生成。若转录语言与目标摘要语言不一致,项目会生成翻译内容。README 中说明,用户可以在 UI 里填写 API Base URL 和 API Key,选择 OpenAI、OpenRouter 或本地 LLM 等 OpenAI 兼容模型服务,避免只能绑定单一云端模型。

Markdown 下载与知识库整理

工具支持下载 Markdown 格式的转录、翻译和摘要文件,方便后续导入 Obsidian、Notion、博客草稿、RAG 知识库或团队文档系统。它更像是内容生产链路前半段的整理工具:先把音视频变成结构化文本,再由用户继续校对、引用、改写、剪辑或发布。

快速部署与使用说明

本地部署前需要准备 Python 3.8+、FFmpeg,以及一个 OpenAI 兼容服务商的 API Key。项目提供自动安装脚本,常见流程是克隆仓库、进入目录、给 install.sh 执行权限并运行安装脚本。手动部署时建议创建 Python 虚拟环境,再安装 requirements.txt。

git clone https://github.com/wendy7756/AI-Video-Transcriber.git
cd AI-Video-Transcriber
chmod +x install.sh
./install.sh

项目也支持 Docker Compose,适合希望减少本地环境差异的用户。Docker 镜像基于 Python 3.12 和 Debian Bookworm,仍需要按实际情况配置 .env 或在 UI 中填写模型接口信息。

git clone https://github.com/wendy7756/AI-Video-Transcriber.git
cd AI-Video-Transcriber
cp .env.example .env
docker-compose up -d

启动服务后,默认访问地址为 http://localhost:8000。处理较长视频时,README 建议使用生产模式启动,避免开发热重载导致长任务中的 SSE 连接断开。

python3 start.py --prod

典型使用流程是:粘贴视频或播客 URL,或上传本地文件;选择摘要语言;在 AI Settings 中填写 API Base URL 和 API Key;选择模型;点击 Transcribe;最后查看优化后的转录稿、翻译和摘要,并按需要下载 Markdown 文件。

配置与资源占用

项目提供几个常用环境变量,包括 OPENAI_API_KEY、HOST、PORT、WHISPER_MODEL_SIZE 和 UPLOAD_MAX_MB。UPLOAD_MAX_MB 默认值为 200 MB,可按服务器能力调整;WHISPER_MODEL_SIZE 默认使用 base,也可以根据机器性能换成 tiny、small、medium 或 large。

配置项说明使用建议
PythonREADME 要求 Python 3.8+本地部署建议使用虚拟环境隔离依赖
FFmpeg用于音频提取和上传媒体归一化处理本地音视频文件前必须确认可用
WHISPER_MODEL_SIZE控制 Whisper 模型大小机器性能有限时先用 tiny 或 base
UPLOAD_MAX_MB本地文件上传大小上限默认 200 MB,调大前评估内存和磁盘
OpenAI 兼容 API用于文本优化、翻译和摘要注意 API 成本、隐私和模型可用性

资源占用会随视频长度、Whisper 模型大小、是否有字幕和硬件性能变化。已有字幕的视频通常不需要完整语音识别;没有字幕的长音频会消耗更多 CPU、内存和处理时间。正式用于团队流程前,建议先用几段典型素材做小规模验证。

适用人群

  • 需要把公开视频、课程、访谈或播客整理成文字稿的内容创作者和编辑。
  • 希望把音视频资料导入 Obsidian、Notion、RAG 知识库或团队文档系统的用户。
  • 愿意自部署工具,并能处理 Python、Docker、FFmpeg 和 API Key 配置的开发者。
  • 需要控制转录文件、摘要结果和模型调用边界的个人或小团队。
  • 只想打开网页立即使用、完全不想部署环境的用户,可能更适合选择托管型转录服务。

编辑整理体验

AI-Video-Transcriber 的价值在于把多个常用环节整合到一个轻量网页应用里:视频链接处理、字幕提取、音频转录、文本优化、翻译、摘要和 Markdown 导出。它没有把重点放在剪辑或发布,而是专注于把音视频内容变成可阅读、可检索、可继续加工的文本。

字幕优先是一个很实际的差异点。很多视频本身已经带有字幕,如果每次都强制走语音识别,不仅耗时,也会浪费本地算力。项目先尝试提取字幕,再用 Faster-Whisper 兜底,适合公开课程、播客节目和创作者内容的批量整理。

需要谨慎的是隐私和版权边界。会议录音、客户访谈、付费课程、内部培训和未公开视频不应随意上传或交给第三方模型处理。即使选择自部署,AI 摘要和翻译仍可能调用外部 API;正式使用前应明确参与者授权、数据保存方式、模型调用位置和输出校对流程。

常见问题(FAQ)

AI-Video-Transcriber 是免费的吗?

项目代码在 GitHub 开源,仓库许可为 Apache-2.0。部署工具本身不等于所有处理都没有成本,AI 优化、翻译和摘要可能需要 OpenAI 兼容接口,相关费用取决于你选择的服务商和模型。

支持哪些平台?

项目 README 提到支持 YouTube、TikTok、Bilibili、Apple Podcasts、SoundCloud 等 30 多个平台,实际范围依赖 yt-dlp 对目标平台的支持和你的网络环境。

没有字幕的视频能处理吗?

可以。没有平台字幕时,工具会使用 Faster-Whisper 进行语音识别。长视频或高质量模型会占用更多时间和硬件资源,机器性能有限时建议先选较小的 Whisper 模型。

Docker 部署适合谁?

Docker 更适合希望减少 Python 依赖差异、快速拉起服务的用户。仍需注意端口、磁盘空间、容器日志、API Key 配置和 FFmpeg/模型处理带来的资源占用。

能处理私密会议或客户录音吗?

技术上可以上传本地文件,但正式处理私密内容前必须确认授权、数据保存位置、外部 API 调用范围和访问权限。涉及客户、员工或未公开资料时,不建议在没有审计和权限控制的环境中使用。

使用建议

AI-Video-Transcriber 适合有一定技术基础、希望自建音视频转录摘要流程的用户。它的优势是输入来源灵活、字幕优先、Whisper 兜底、OpenAI 兼容模型可配置,并能输出 Markdown 文件,适合和个人知识库或内容生产流程衔接。

如果你只是偶尔转录一两个短视频,托管型网页工具可能更省事;如果你经常整理课程、播客、访谈或公开视频,并且希望控制转录数据和模型选择,这类自部署项目更值得保留。正式用于商业内容或团队资料前,建议先核对 Apache-2.0 许可、目标平台条款、音视频版权和隐私合规要求。

AI-Video-Transcriber | 开源转录工具 - 视频播客摘要 - Docker可部署 - 杂货喵
AI-Video-Transcriber | 开源转录工具 – 视频播客摘要 – Docker可部署
此内容为免费资源,请登录后查看
0积分
发布平台GitHub
编码语言JavaScript、Python...
支持语言中英文多语言
收录日期2026年7月5日
Stars2.9k
Forks391
免费资源
© 版权声明
THE END
喜欢就支持一下吧
点赞3
评论 抢沙发
头像 - 杂货喵
欢迎您留下宝贵的见解!
提交
头像 - 杂货喵

昵称

取消
昵称图片快捷回复

    暂无评论内容