[python]基于faster whisper实时语音识别语音转文本_fast whisper

作者：菜鸟追梦旅行 | 2024-06-06 12:42:02

踩

fast whisper

介绍：

Faster-Whisper是一个基于OpenAI的Whisper模型的高效实现。它利用CTranslate2，一个专为Transformer模型设计的快速推理引擎，优化了内存使用效率。同时，Faster-Whisper还改进了原始的Whisper模型结构，包括减少模型的层数、减少参数量、简化模型结构等，从而减少了计算量和内存消耗，提高了推理速度。此外，Faster-Whisper还改进了推理算法、优化计算过程、减少冗余计算等，以提高模型的运行效率。

Faster-Whisper项目包括一个web网页版本和一个命令行版本，同时项目内部已经整合了VAD算法。VAD是一种音频活动检测的算法，可以准确的把音频中的每一句话分离开来，让whisper更精准的定位语音开始和结束的位置。

faster whisper地址：

https://github.com/SYSTRAN/faster-whisper

实现功能：

从麦克风获取声音进行实时语音识别转文本

代码仅仅用了40多行即可实现实时语音转文本功能

封装成类调用十分简单，代码如下：

fwm = FasterWhisperManager()
fwm.start()
while True:
time.sleep(0.2)
视频演示地址：

bilibili.com/video/BV1fQ4y1j7wb/

源码地址：

https://download.csdn.net/download/FL1623863129/88684862

声明：本文内容由网友自发贡献，不代表【wpsshop博客】立场，版权归原作者所有，本站不承担相应法律责任。如您发现有侵权的内容，请联系我们。转载请注明出处：https://www.wpsshop.cn/w/菜鸟追梦旅行/article/detail/680972