
3 步跑通 Silero VAD语音活动检测的完整安装配置指南【免费下载链接】silero-vadSilero VAD: pre-trained enterprise-grade Voice Activity Detector项目地址: https://gitcode.com/GitHub_Trending/si/silero-vad如果你需要从一段音频里自动圈出人说话的部分那么 Silero VADSilero VAD 语音活动检测工具就是干这个的它是一组预训练好的模型喂给它一段音频它会告诉你哪些时间段是语音、哪些是静音。整个过程不需要你懂深度学习装好就能用。先说结论它凭什么值得用很多人第一次接触语音活动检测以为要折腾半天模型训练其实不必。Silero VAD 的几个特点刚好戳中了边缘场景的痛点够小JIT 模型只有约 2MB放进 IoT 设备或移动端的安装包毫无压力够快单条 CPU 线程处理一块 30ms 以上的音频片段耗时不到 1ms完全来得及做实时检测够准在超过 6000 种语言的语料上训练过对不同背景噪声、不同音频质量的鲁棒性都不错够通用同时支持 8000Hz 和 16000Hz 采样率依赖 PyTorch 和 ONNX 两套生态几乎什么平台都能跑起来。换句话说做语音助手的前端唤醒、会议录音的说话人切分、实时流里的静音裁剪它都能直接顶上。动手前先过一遍环境检查清单 装之前花 30 秒确认下面几项能省掉后面 80% 的报错Python 版本 ≥ 3.8python --version看一眼系统里能正常用 pip内存 1GB 以上CPU 支持 AVX 指令集近十年内的 x86 机器基本都满足音频读取依赖 PyTorch 生态后面会一并装上如果只打算用 ONNX 模型跑机器架构只要 onnxruntime 支持即可限制更小。全部打勾就可以开始了。pip 一条命令装好 Silero VAD整个安装其实就三步跟着敲就行。第 1 步装 PyTorch。它是推理时的运行底座官方依赖版本是torch1.12.0直接装最新版即可。第 2 步装 Silero VAD。包名就是silero-vad它会顺带把torchaudio等依赖一起拉下来pip install torch pip install silero-vad到这里核心环境就齐了。不用手动下模型文件模型随 pip 包一起分发。第 3 步5 秒验证模型是否可用。打开 Python 交互式终端贴入下面这段最小验证代码——加载模型、读一段音频、拿回语音时间戳三步走完from silero_vad import load_silero_vad, read_audio, get_speech_timestamps model load_silero_vad() wav read_audio(path_to_audio_file) # 换成你自己的音频文件路径 speech_timestamps get_speech_timestamps(wav, model, return_secondsTrue) print(speech_timestamps)return_secondsTrue让结果直接以秒为单位返回比默认按采样点返回好看得多。只要打印出一组时间段而不是报错恭喜语音活动检测环境已经配置完成。仓库里还附了测试音频可以直接拿 tests/data/test.wav 来试。想再快一点选装 ONNX Runtime 不装也完全能用装了推理速度在某些条件下最高可以快 4~5 倍pip install onnxruntime要求版本 ≥ 1.16.1。装完后代码里改用 ONNX 模型即可仓库 src/silero_vad/data/ 下已经带了多个现成的 ONNX 模型文件包括支持 16kHz 和 half 精度的版本。装完之后去哪看遇到问题优先翻官方文档 README.md里面有质量指标、性能数据、依赖细节和更多用法核心逻辑都在 src/silero_vad/ 源码目录里model.py和utils_vad.py两个文件读完基本就摸清了它的工作方式。一句话回顾环境清单打勾 →pip install silero-vad→ 三行代码验证Silero VAD 的安装配置到这里就全部完成了。剩下的时间留给你真正要做的语音检测逻辑吧。【免费下载链接】silero-vadSilero VAD: pre-trained enterprise-grade Voice Activity Detector项目地址: https://gitcode.com/GitHub_Trending/si/silero-vad创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考