audio-speaker-tools - 说话人分离与音频处理工具
使用Demucs、pyannote和Resemblyzer分离说话人、比较语音和处理音频文件
标签
更新于: 2026-03-24能力
典型输入
典型输出
该技能可以做什么
- 分离音频中的说话人
- 比较语音样本
- 提取音频片段
- 分离人声
- 验证说话人识别结果
- 准备语音样本
输入
- 音频文件
- HuggingFace令牌
- 说话人数量范围
输出
- 分离的说话人音频文件
- 语音相似度分数
- 音频片段
- 说话人识别元数据文件
要求
- Python 3.9+
- ffmpeg
- PyTorch MPS支持
- HuggingFace令牌
