speech-to-text - 使用Whisper模型进行音频转录通过inference.sh CLI使用Whisper模型将音频转录为文本标签更新于: 2026-02-23音频转录whisper语音翻译字幕能力典型输入典型输出该技能可以做什么音频转录音频翻译生成时间戳检测语言从视频提取音频输入音频文件音频URL视频文件API密钥输出文本转录JSON转录数据带时间戳的分段语言检测结果要求inference.sh CLI安装inference.sh登录认证有效的音频/视频输入来源规范: SKILL.md