whisper - 强健的多语言语音识别与翻译
使用 Whisper 模型对 99 种语言的音频进行转写,并支持将语音翻译为英文文本。
标签
更新于: 2026-09-18能力
典型输入
典型输出
该技能可以做什么
- 将音频转写为文本
- 将语音翻译为英文文本
- 生成字词级时间戳
- 将转写内容导出为字幕文件
- 通过命令行执行语音转写
输入
- 音频文件
- 视频文件
- 语言代码
- 初始提示文本
输出
- 转写文本
- TXT 文本文件
- SRT 字幕文件
- WebVTT 字幕文件
- JSON 格式输出文件
要求
- Python 3.8-3.11
- ffmpeg
- openai-whisper 依赖包
- Linux 或 macOS 操作系统
