简介
AI-Video-Transcriber 是一个面向视频、播客、课程、访谈和会议录音整理场景的开源 AI 转录工具,支持从公开视频链接或本地音视频文件生成文字稿,并进一步做文本优化、翻译和摘要。杂货喵小编根据 WarpNav 源文、GitHub 仓库、README 和项目说明整理,以本文介绍它的功能定位、部署方式、适用场景、隐私边界和使用注意事项。
项目由 wendy7756 维护,主要使用 Python 开发,仓库采用 Apache-2.0 许可。它把 yt-dlp、FFmpeg、Faster-Whisper、FastAPI 和 OpenAI 兼容接口组合成一个可自部署的网页应用,适合想把长视频、播客或课程内容整理成可搜索、可编辑 Markdown 文档的用户。需要注意的是,它不是零配置在线 SaaS,部署前仍要准备 Python、FFmpeg、API Key 或可用的 OpenAI 兼容模型服务。

本文要点
- 支持 YouTube、TikTok、Bilibili、Apple Podcasts、SoundCloud 等 yt-dlp 可处理的平台链接,也支持本地文件上传。
- 支持 .txt、.mp3、.mp4、.m4a、.wav、.webm、.mkv、.ogg、.flac 等输入格式,其中 .txt 会跳过 Whisper 直接进入文本处理流程。
- 项目采用“字幕优先”思路:有平台字幕时优先提取字幕,没有字幕时再回退到 Faster-Whisper 转录。
- 可在 UI 中配置 OpenAI、OpenRouter、本地 LLM 等 OpenAI 兼容接口,用于文本优化、翻译和摘要。
- 支持 install.sh、本地 Python 虚拟环境、Docker 和 Docker Compose 部署;长视频建议使用生产模式启动。
相关链接
- GitHub 仓库:https://github.com/wendy7756/AI-Video-Transcriber
- 项目主页:https://sipsip.ai
- WarpNav 源文:https://warpnav.com/ai-video-transcriber-github
- yt-dlp:https://github.com/yt-dlp/yt-dlp
- Faster-Whisper:https://github.com/guillaumekln/faster-whisper
核心功能说明
多平台链接与本地文件输入
AI-Video-Transcriber 可以处理视频、播客 URL,也可以上传本地音频、视频或纯文本文件。公开视频链接主要依赖 yt-dlp 支持的平台范围,本地媒体文件则通过 FFmpeg 做格式归一化后交给 Whisper 流程处理。对内容整理者来说,这意味着同一套界面可以覆盖公开视频、播客音频、会议录音、课程文件和已有文字稿。
字幕优先与 Faster-Whisper 兜底
项目的一个实用设计是字幕优先。对于已有原生字幕的平台内容,工具会优先提取字幕文本,不必每次下载音频再做语音识别;没有字幕时,再使用 Faster-Whisper 进行转录。这个逻辑适合批量整理 YouTube 课程、公开视频和已有字幕的节目,也能在无字幕内容上保留转录能力。
AI 优化、翻译与摘要
转录完成后,AI-Video-Transcriber 可以对文本做错字修正、句子补全、段落整理和摘要生成。若转录语言与目标摘要语言不一致,项目会生成翻译内容。README 中说明,用户可以在 UI 里填写 API Base URL 和 API Key,选择 OpenAI、OpenRouter 或本地 LLM 等 OpenAI 兼容模型服务,避免只能绑定单一云端模型。
Markdown 下载与知识库整理
工具支持下载 Markdown 格式的转录、翻译和摘要文件,方便后续导入 Obsidian、Notion、博客草稿、RAG 知识库或团队文档系统。它更像是内容生产链路前半段的整理工具:先把音视频变成结构化文本,再由用户继续校对、引用、改写、剪辑或发布。
快速部署与使用说明
本地部署前需要准备 Python 3.8+、FFmpeg,以及一个 OpenAI 兼容服务商的 API Key。项目提供自动安装脚本,常见流程是克隆仓库、进入目录、给 install.sh 执行权限并运行安装脚本。手动部署时建议创建 Python 虚拟环境,再安装 requirements.txt。
git clone https://github.com/wendy7756/AI-Video-Transcriber.git
cd AI-Video-Transcriber
chmod +x install.sh
./install.sh
项目也支持 Docker Compose,适合希望减少本地环境差异的用户。Docker 镜像基于 Python 3.12 和 Debian Bookworm,仍需要按实际情况配置 .env 或在 UI 中填写模型接口信息。
git clone https://github.com/wendy7756/AI-Video-Transcriber.git
cd AI-Video-Transcriber
cp .env.example .env
docker-compose up -d
启动服务后,默认访问地址为 http://localhost:8000。处理较长视频时,README 建议使用生产模式启动,避免开发热重载导致长任务中的 SSE 连接断开。
python3 start.py --prod
典型使用流程是:粘贴视频或播客 URL,或上传本地文件;选择摘要语言;在 AI Settings 中填写 API Base URL 和 API Key;选择模型;点击 Transcribe;最后查看优化后的转录稿、翻译和摘要,并按需要下载 Markdown 文件。
配置与资源占用
项目提供几个常用环境变量,包括 OPENAI_API_KEY、HOST、PORT、WHISPER_MODEL_SIZE 和 UPLOAD_MAX_MB。UPLOAD_MAX_MB 默认值为 200 MB,可按服务器能力调整;WHISPER_MODEL_SIZE 默认使用 base,也可以根据机器性能换成 tiny、small、medium 或 large。
| 配置项 | 说明 | 使用建议 |
|---|---|---|
| Python | README 要求 Python 3.8+ | 本地部署建议使用虚拟环境隔离依赖 |
| FFmpeg | 用于音频提取和上传媒体归一化 | 处理本地音视频文件前必须确认可用 |
| WHISPER_MODEL_SIZE | 控制 Whisper 模型大小 | 机器性能有限时先用 tiny 或 base |
| UPLOAD_MAX_MB | 本地文件上传大小上限 | 默认 200 MB,调大前评估内存和磁盘 |
| OpenAI 兼容 API | 用于文本优化、翻译和摘要 | 注意 API 成本、隐私和模型可用性 |
资源占用会随视频长度、Whisper 模型大小、是否有字幕和硬件性能变化。已有字幕的视频通常不需要完整语音识别;没有字幕的长音频会消耗更多 CPU、内存和处理时间。正式用于团队流程前,建议先用几段典型素材做小规模验证。
适用人群
- 需要把公开视频、课程、访谈或播客整理成文字稿的内容创作者和编辑。
- 希望把音视频资料导入 Obsidian、Notion、RAG 知识库或团队文档系统的用户。
- 愿意自部署工具,并能处理 Python、Docker、FFmpeg 和 API Key 配置的开发者。
- 需要控制转录文件、摘要结果和模型调用边界的个人或小团队。
- 只想打开网页立即使用、完全不想部署环境的用户,可能更适合选择托管型转录服务。
编辑整理体验
AI-Video-Transcriber 的价值在于把多个常用环节整合到一个轻量网页应用里:视频链接处理、字幕提取、音频转录、文本优化、翻译、摘要和 Markdown 导出。它没有把重点放在剪辑或发布,而是专注于把音视频内容变成可阅读、可检索、可继续加工的文本。
字幕优先是一个很实际的差异点。很多视频本身已经带有字幕,如果每次都强制走语音识别,不仅耗时,也会浪费本地算力。项目先尝试提取字幕,再用 Faster-Whisper 兜底,适合公开课程、播客节目和创作者内容的批量整理。
需要谨慎的是隐私和版权边界。会议录音、客户访谈、付费课程、内部培训和未公开视频不应随意上传或交给第三方模型处理。即使选择自部署,AI 摘要和翻译仍可能调用外部 API;正式使用前应明确参与者授权、数据保存方式、模型调用位置和输出校对流程。
常见问题(FAQ)
AI-Video-Transcriber 是免费的吗?
项目代码在 GitHub 开源,仓库许可为 Apache-2.0。部署工具本身不等于所有处理都没有成本,AI 优化、翻译和摘要可能需要 OpenAI 兼容接口,相关费用取决于你选择的服务商和模型。
支持哪些平台?
项目 README 提到支持 YouTube、TikTok、Bilibili、Apple Podcasts、SoundCloud 等 30 多个平台,实际范围依赖 yt-dlp 对目标平台的支持和你的网络环境。
没有字幕的视频能处理吗?
可以。没有平台字幕时,工具会使用 Faster-Whisper 进行语音识别。长视频或高质量模型会占用更多时间和硬件资源,机器性能有限时建议先选较小的 Whisper 模型。
Docker 部署适合谁?
Docker 更适合希望减少 Python 依赖差异、快速拉起服务的用户。仍需注意端口、磁盘空间、容器日志、API Key 配置和 FFmpeg/模型处理带来的资源占用。
能处理私密会议或客户录音吗?
技术上可以上传本地文件,但正式处理私密内容前必须确认授权、数据保存位置、外部 API 调用范围和访问权限。涉及客户、员工或未公开资料时,不建议在没有审计和权限控制的环境中使用。
使用建议
AI-Video-Transcriber 适合有一定技术基础、希望自建音视频转录摘要流程的用户。它的优势是输入来源灵活、字幕优先、Whisper 兜底、OpenAI 兼容模型可配置,并能输出 Markdown 文件,适合和个人知识库或内容生产流程衔接。
如果你只是偶尔转录一两个短视频,托管型网页工具可能更省事;如果你经常整理课程、播客、访谈或公开视频,并且希望控制转录数据和模型选择,这类自部署项目更值得保留。正式用于商业内容或团队资料前,建议先核对 Apache-2.0 许可、目标平台条款、音视频版权和隐私合规要求。














暂无评论内容