2026/9/5 23:36:54

faster-whisper安装指南:语音转文字快4倍

faster-whisper安装指南:语音转文字快4倍 faster-whisper安装指南语音转文字快4倍【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 用 Whisper 模型做语音转文字它基于 CTranslate2一个专门加速 Transformer 模型推理的引擎重写了 OpenAI Whisper相同准确率下比官方 openai/whisper 最快快 4 倍占的内存还更少。这篇文章带你花 10 分钟装好它并亲眼看到自己的第一条转录结果。安装 faster-whisper 前的环境自检清单操作系统Windows、macOS、Linux 均可不需要额外装系统级依赖。Python 版本需要 3.9 或更高setup.py 里声明python_requires3.9。查看当前版本python --version执行后应看到 3.9 及以上的数字低于 3.9 先升级 Python。GPU 与驱动可选没有 NVIDIA 显卡也能用 CPU 跑想用 GPU 加速则要求 CUDA 12 cuDNN 9 的 NVIDIA 库最新的 ctranslate2 只支持这个组合。用nvidia-smi查看执行后应看到驱动版本和一行CUDA Version: 12.x。不需要 FFmpeg和官方 Whisper 不同音频解码由 PyAV 库完成它把 FFmpeg 库打包在了自己内部你无需单独安装。python --version nvidia-smi第一条执行后应看到Python 3.9.x或更高第二条没显卡会报错忽略即可。faster-whisper 安装命令一条 pip 搞定pip 安装稳定版目的把 faster-whisper 及其依赖ctranslate2、av、huggingface_hub 等装进当前环境。pip install faster-whisper执行完你应该在末尾看到Successfully installed faster-whisper-1.2.1中间过程会依次拉取 ctranslate2、av 等依赖。想装 master 分支的最新代码可以改用pip install --force-reinstall faster-whisper master 分支 tar 包地址新手建议先用稳定版。装完顺手确认一下在终端执行python -c import faster_whisper; print(faster_whisper.__version__)看到1.2.1就说明导入成功。克隆仓库拿一段示例音频目的验证环节需要一段音频仓库自带 JFK 演讲的录音文件。git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper执行后当前目录会多出一个faster-whisper文件夹里面tests/data/jfk.flac就是我们待会的输入音频。选对 faster-whisper 参数模型大小与设备怎么选参数默认值建议理由模型大小WhisperModel第一个参数无默认必填CPU 用tiny.en/baseGPU 用large-v3或turbo越大越准但越吃内存仓库基准测试里 int8 量化的 small 模型 CPU 上只占约 1.5GB 内存deviceauto保持auto自动检测有没有 GPU没有就落到 CPUcompute_typedefaultGPU 传float16CPU 传int88 位量化是它省内存的杀手锏基准里 large-v2 GPU 上 int8 显存从 4525MB 降到 2926MBbeam_sizetranscribe参数5保持 5调高更准但更慢注意官方 openai/whisper 默认是 1对比性能时别搞混vad_filterFalse音频前后静音多就设True内置 Silero VAD 模型自动跳过无人声片段faster-whisper 首次转录跑通示例验证下面这段代码可以直接运行前提是你已克隆仓库、正站在仓库根目录from faster_whisper import WhisperModel model WhisperModel(tiny.en, devicecpu, compute_typeint8) segments, info model.transcribe(tests/data/jfk.flac) print(Detected language %s with probability %f % (info.language, info.language_probability)) for segment in segments: print([%.2fs - %.2fs] %s % (segment.start, segment.end, segment.text))执行后会先发生一次模型下载——按名字从 Hugging Face Hub 拉取 CTranslate2 格式的模型并缓存到本地之后就不用了。成功标志有两个第一行输出Detected language en with probability 0.999...随后是带时间戳的英文逐句文字内容以And so my fellow Americans开头这是 JFK 演讲的开头。看到这两样你的安装就真正跑通了。faster-whisper 报错急救高频问题怎么办QGPU 加载模型时报 cuBLAS / cuDNN 相关的错A说明缺 NVIDIA 运行库。Linux 可执行pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*再按 README 里的方法导出LD_LIBRARY_PATH后启动 Python急用先改成devicecpu顶过去。Q我是 CUDA 11 的环境直接报不兼容A最新 ctranslate2 只支持 CUDA 12。CUDA 11 cuDNN 8 就执行pip install --force-reinstall ctranslate23.24.0CUDA 12 配 cuDNN 8 则降级到ctranslate24.4.0。Qpip 明明装成功了却提示No module named faster_whisperA终端里的 python 和装包的 pip 不是同一个解释器。改用python -m pip install faster-whisper确保装进正在运行的这个环境。Q第一次运行卡在下载或特别慢A首次运行会下载模型文件模型越大越久之后走本地缓存就快了。网络不好时先用tiny.en这类小模型验证流程。装好之后下一步可以给transcribe加上word_timestampsTrue拿到逐词时间戳或者换成BatchedInferencePipeline做批量转录仓库 README 的 Batched Transcription 一节有完整示例。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考