2026/8/29 8:37:42

Whisper 语音识别实战:3 条命令把本地音频转成文字

Whisper 语音识别实战:3 条命令把本地音频转成文字 Whisper 语音识别实战3 条命令把本地音频转成文字【免费下载链接】whisperRobust Speech Recognition via Large-Scale Weak Supervision项目地址: https://gitcode.com/GitHub_Trending/whisp/whisper朋友想把一段会议录音转成文字和字幕又不想搭后端、申请 ASR 接口我试了 Whisper 语音识别这套方案。纯本地运行pip 装完就能用没有网络依赖转出来的文本格式随你挑。语音转文字能做什么先说它能干什么免得你拿错工具多语言语音识别98 种语言直接转写不指定语言时会基于前 30 秒自动检测。适合做播客、访谈、课程录音的转文字。语音翻译成英文--task translate把任意语种音频直接翻成英文文本转写和翻译一个模型搞定。适合整理多语言素材。多任务统一语言识别、时间戳对齐都内建一个序列到序列模型替掉了传统语音处理流水线里的多个环节。5 分钟跑通环境第 1 步装 ffmpeg。Whisper 靠它解码音频缺了会在跑的时候直接报错# Ubuntu / Debian sudo apt update sudo apt install ffmpeg # macOS brew install ffmpeg第 2 步安装 Whispergit clone https://gitcode.com/GitHub_Trending/whisp/whisper cd whisper pip install -r requirements.txt装完敲whisper --help能看到一长串参数说明 CLI 就绪。第 3 步首次调用。仓库自带测试音频tests/jfk.flacwhisper jfk.flac首次运行会自动下载模型并缓存到~/.cache/whisper。跑完这步你应该在当前目录看到同名的 .txt、.srt、.vtt、.json 等文件控制台还会打印检测到的语言。第 4 步换 Python API 验证import whisper model whisper.load_model(turbo, devicecpu) result model.transcribe(jfk.flac) print(result[text])控制台打出 JFK 那段英文演讲的转写就算全部跑通。影响体验最大的 4 个配置项配置项推荐值为什么这么设--modelturbo默认速度约 8 倍、精度接近 large没 GPU 就换small--language知道就说如Chinese不指定会基于前 30 秒自动检测中英混杂时手动指定更稳--tasktranscribe/translate要翻译必须显式指定且 turbo 不支持翻译任务--output_formatsrt/json默认输出 6 种格式做字幕挑 srt程序消费挑 json实际跑下来会踩的坑一、报FileNotFoundError: ffmpeg。系统没装 ffmpegWhisper 用它解码所有输入音频。按上面第 1 步装好重跑即可。二、用 turbo 翻译日语出来的还是日语原文。turbo 是 large-v3 的加速裁剪版根本没训过翻译任务--task translate对它不生效。想翻译就把模型换成medium或large。三、音频里的长静音被转写出一堆重复文本幻觉。弱监督训练的模型遇到无语音片段会脑补内容。把--no_speech_threshold调低或直接用--clip_timestamps跳过静音段。 还有一个隐性坑没有 CUDA 时 Python API 的load_model会默认选 GPU 设备得显式传devicecpuCLI 则会自动回退。接下来可以试试加--word_timestamps True开词级时间戳字幕可以精确到每个字用--initial_prompt喂一段领域词汇专有名词识别错误率肉眼可见地下降想深入底层notebooks/LibriSpeech.ipynb 里有detect_language()和decode()的完整调用流程照着改就行。【免费下载链接】whisperRobust Speech Recognition via Large-Scale Weak Supervision项目地址: https://gitcode.com/GitHub_Trending/whisp/whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考