AI-Video-Transcriber 是什么
AI-Video-Transcriber 是开源的视频/播客转录与摘要工具:粘贴 YouTube、Bilibili、抖音、Apple Podcasts、SoundCloud 等 yt-dlp 可处理的公开链接,或上传本地音视频/纯文本,生成可下载的 Markdown 转录、翻译和摘要。仓库由 wendy7756 维护,许可为 Apache-2.0;技术栈围绕 FastAPI、yt-dlp、FFmpeg、Faster-Whisper 与 OpenAI 兼容接口。
它不是零配置在线 SaaS。本地或 Docker 部署前需要准备 Python/FFmpeg(或容器环境),以及用于优化/翻译/摘要的 OpenAI 兼容 API。截至 2026 年 7 月核对,GitHub 约 3.0k stars;Stars/Forks 会变化,以仓库页为准。
本文要点
- 字幕优先:有平台字幕时先提取,无字幕再回退 Faster-Whisper。
- 输入灵活:公开链接 + 本地 .mp3/.mp4/.wav/.mkv 等;.txt 跳过 Whisper 直接进文本管线。
- 摘要/翻译走 OpenAI 兼容接口,可在 UI 配置 Base URL、Key 与模型。
- 支持 install.sh、venv、Docker Compose;默认 http://localhost:8000。

字幕优先、本地上传与 Markdown 导出
链接任务
粘贴链接后,进度会区分 Subtitle(有原生字幕,通常更快)与 Whisper(无字幕,需下载音频再识别)。实际平台范围取决于 yt-dlp 对目标站的支持与你的网络环境,不要写成“永久覆盖所有站点”。
本地文件
拖放或选择文件后走同一处理入口。音视频经 FFmpeg 归一化再进 Whisper;纯 .txt 不做语音识别,直接进入优化与摘要。适合会议录音、课程文件和已有文稿的二次整理。
AI 与导出
转录后可做错字修正、段落整理、条件翻译和摘要,并下载 Markdown,便于导入笔记或 RAG。摘要质量取决于所选模型;人名、数字、专有名词仍建议人工复核。
Docker / 本地怎么部署
常用依赖:Python 3.8+、FFmpeg、可用的 OpenAI 兼容服务。环境变量常见项包括 OPENAI_API_KEY、WHISPER_MODEL_SIZE(默认 base)、UPLOAD_MAX_MB(默认 200)、HOST/PORT。机器吃紧时先用 tiny/base;长视频建议生产模式启动,避免开发热重载打断长任务。
git clone https://github.com/wendy7756/AI-Video-Transcriber.git
cd AI-Video-Transcriber
cp .env.example .env
docker-compose up -d
- 仓库:https://github.com/wendy7756/AI-Video-Transcriber
- 项目站:https://sipsip.ai
- yt-dlp:https://github.com/yt-dlp/yt-dlp
- Faster-Whisper:https://github.com/SYSTRAN/faster-whisper
- 克隆仓库并配置 .env(或稍后在 UI 填 API)。
- Docker Compose 启动,或按 README 用 install.sh / venv。
- 打开 localhost:8000,粘贴链接或上传文件,选语言与模型后开始转录。
- 下载 Markdown 前先抽查关键信息。
隐私、版权与成本
- 代码开源不等于处理免费:摘要/翻译可能产生 API 费用。
- 会议录音、客户访谈、付费课程、未公开视频:先确认授权;外部 API 可能离开本机。
- 遵守目标平台条款与版权;自部署也不能把未授权内容批量转成对外资料。













暂无评论内容