2026/9/6 20:38:12

Buzz 语音转录工具指南:离线语音转文字、导出字幕,从首次运行到批量处理

Buzz 语音转录工具指南:离线语音转文字、导出字幕,从首次运行到批量处理 Buzz 语音转录工具指南离线语音转文字、导出字幕从首次运行到批量处理【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz整理一段 90 分钟的会议录音光是把口述内容敲成文字并对齐时间戳往往就要耗掉一个下午。Buzz 是一款免费开源的语音转录工具它能在你自己的电脑上本地运行 OpenAI 的 Whisper 模型完成语音转文字并支持翻译与字幕导出全程离线、无需上传云端。产品定位Buzz 是本地化方案不是云端服务Buzz 是一款基于 Whisper 语音模型的桌面应用内置 transformers、whisper.cpp 等多个本地推理引擎核心代码位于 buzz/transcriber/。与常见的云端转录服务相比差异集中在三点对比项云端转录服务Buzz音频去向需上传到服务商服务器全程留在本机计费方式通常按分钟收费免费仅首次需下载模型网络依赖全程依赖网络模型下载完成后可离线使用如果你的音频涉及未公开的业务内容或者转录量大、希望把成本压下来这种离线语音转文字的思路就值得考虑。快速上手从安装到跑通第一条结果这一节把安装、首次配置、跑出第一条转录结果合并成一条完整路径。第一步获取代码并安装依赖git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz pip install -e . python -m buzzLinux 用户也可以改用 Flatpak 或 Snap 渠道直接安装省去手动配依赖。第二步做一遍基础配置首次启动后打开偏好设置页做一次基础配置选择默认模型入门建议 Tiny 或 Base、勾选需要自动导出的格式TXT、SRT、VTT、JSON 等。第三步导入音频拿到第一条结果通过菜单「导入文件」或快捷键 CtrlO 导入任意一段音频任务会自动进入队列并开始处理。完成后在任务列表中点开记录即可在查看器中逐段核对文本并选择格式导出。场景实测三种典型用法会议录音实时转文字适用情况开会、访谈、讲座时边听边记来不及。操作按 CtrlR 打开录音窗口选好麦克风和语言后开始录制音频会按固定片段持续转写内容可以当场看到。注意点文字展示相对实际说话有若干秒延迟这是分段转写的正常现象不要据此判断识别出错片段长度与延迟可在录音相关设置里调整。已有音频文件批量转写适用情况手头有 MP3、WAV、MP4 等文件需要拿到文本或字幕。操作CtrlO 多选导入语言默认自动检测如果已知语种手动指定通常更准。任务结束后打开转录查看器文字与音频逐段对齐并带时间戳可以直接改字、微调每段的起止时间。转写与翻译一次完成适用情况外语访谈、外语课程视频、跨国会议。操作在任务的转写选项里把任务类型从 Transcribe 改为 Translate 并选定目标语言结果中会同时保留原文与译文还可以只导出译文这一份 SRT 字幕直接用于视频。进阶调优让批量处理更顺手的 5 个配置固定默认模型与缓存路径模型大小直接决定内存占用和速度。在偏好设置的模型页models_preferences_widget.py里设定常用模型和缓存目录换目录、换项目时不必重复下载。开启文件夹监听在偏好设置中配置要监听的目录实现见 transcription_task_folder_watcher.py之后放进目录的音频会自动排队转写适合固定投放录音文件的团队流程。自定义导出文件名模板在偏好设置中把默认命名模板改成{{input_file_name}}_{{date_time}}这类格式批量处理同名文件时不会互相覆盖。按手熟度改快捷键CtrlO导入文件、CtrlR打开录音窗口、CtrlT查看时间戳等默认项都可在偏好设置的快捷键页里重新定义清单见 buzz/settings/shortcut.py。有独显就启用 GPUNVIDIA 显卡按项目说明配置 CUDA 后长音频的处理耗时会明显下降参考 buzz/cuda_setup.py。常见问题转录速度很慢怎么办先把模型换小Tiny 或 Base有独显的机器检查 CUDA 是否生效再关掉同机器上吃 CPU 的程序。模型越小速度越快精度相应下降按内容取舍。专业词汇反复识别错怎么解决在任务的 Initial prompt初始提示词里写上正确的写法例如人名、产品名、术语各列一句示例Whisper 转写时会向这个拼写靠拢这是免费的纠偏手段。查看器里音频放不出声音播放依赖系统的 FFmpeg 组件Linux 上先确认已安装 ffmpeg再检查偏好设置中的播放设备选择是否正确。适合谁用下一步做什么Buzz 适合需要离线、免费做语音转文字的场景会议整理、访谈记录、字幕制作以及不想把音频交给第三方的用户。建议先 clone 仓库用 Base 模型转一段自己的真实音频跑通全流程再按内容类型回头调整模型大小与导出格式。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考