2026/9/7 9:59:51

离线音频转录工具 Buzz 实战:从会议录音到逐字稿只要 4 步

离线音频转录工具 Buzz 实战:从会议录音到逐字稿只要 4 步 离线音频转录工具 Buzz 实战从会议录音到逐字稿只要 4 步【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一个跑在自己电脑上的离线音频转录工具会议录音、采访素材、播客文件丢进去Whisper 模型在本地跑出文字音频从头到尾不经过任何第三方服务器。下面不按功能清单讲直接按你要干的事来——出逐字稿、给视频配字幕、做实时转写、跑批量素材每件活配几条顺手就能用的设置。 先把 Buzz 装进电脑安装分三条路看你的系统macOS下载官方 .dmg 安装包拖进「应用程序」就行。Windows从发布页下载安装包。程序未签名安装时弹警告选「更多信息」再点「仍要运行」即可不是病毒。LinuxFlatpak 和 Snap 两条路都行Snap 需要先装几个音频依赖库sudo snap install buzz也支持从 Python 安装需要 Python 3.12且系统里已有 ffmpegpip install buzz-captions python -m buzz装完先别急着导入文件。打开「偏好设置 → 模型」把要用的模型下下来——模型缓存在用户目录下Linux 是~/.cache/BuzzmacOS 在~/Library/Caches/Buzz后面手动管理模型都认这个目录。️ 会议录音变逐字稿流程就四步导入、选模型、定语言、点开始。把音频拖进主窗口或点左上角加号导入MP3、WAV、M4A、MP4 都收直接粘一个视频链接让它先下载再转也可以。模型后端选错会又慢又卡Buzz 内置四种 Whisper 后端差异比模型大小更影响体验Whisper原版实现结果稳但慢、吃内存老机器慎选。Faster WhisperN 卡显存 6GB 以上首选速度甩原版几条街。Whisper.cppC 实现核显、纯 CPU 都能跑Mac 用户基本闭眼选它。HuggingFace能装社区自定义模型还支持 MMS 系列语言覆盖上千种。模型大小分 tiny 到 large 五档。机器一般先用 base 或 small 出初稿重要内容再上 medium 或 large 重跑。注意带.En后缀的模型只认英语其他语言别选错。语言和初始提示词两个容易被忽略的开关语言栏留空就是自动检测中英混说也能应付语种确定时手动指定会更稳。另一个常被跳过的是「初始提示词」把人名、产品名、专业术语写进去模型会优先按这些发音去匹配同音词写错的概率能明显降下来。 给视频配一套能直接用的字幕转完先别急着导出。查看器里每句话都能点开听原声、改文字、拖时间轴逐句校对完再导出 SRT 或 VTT拖进剪辑软件就是成品。勾选词级时间戳之后还能做逐字高亮字幕和说话人区分。Buzz 自带字幕重排设一下每条字幕的最大长度和合并间隔它会把碎句合并、把长句拆开导出前就排好版省一道在字幕软件里修时间的活。偏好设置里还能自定义导出文件名模板把日期、语种、模型名带进文件名批量出稿时不会混。更多模板变量可以翻 偏好设置文档。 讲座、直播的现场实时转写点录音按钮Buzz 边录边转文字逐句滚出来。站在台上的人可以开「演示窗口」——独立的全屏大字体窗口投出来给观众看讲到的内容。实时拼接有三种模式新句追加在下方、上方或者「追加并修正」——后者会回头修上一句的尾字效果最好但更吃算力配置弱就选前两种。打开「实时导出」后文字同步写进一个 txt 文件OBS 的文本源直接读它讲稿内容就能上直播画面。️ 一周的采访素材丢进监控文件夹偏好设置里有「文件夹监控」指定一个目录往里丢的每个音频自动排队转录用的都是你预设的参数。一周的素材挂上去基本就是无人值守。想更省事用内置命令行写进脚本比如指定 medium 模型并直接产出 SRTbuzz add --model-size medium --srt 采访01.mp3 采访02.mp3装好插件后还能挂 AI 摘要每份逐字稿跑完自动附一段总结。录音环境吵的话转录前先跑一遍「语音分离」把人声提出来准确率会稳很多插件清单见 使用文档。⚠️ 技巧与避坑没有网的机器也能跑Buzz 转录全程离线模型只需下载一次。目标机器没网的话在有网的电脑上下好模型把 models 整个文件夹拷过去就行仓库里的scripts/download-models.py可以一次性备齐离线缓存。卡住了先看这几处转得太慢先降一档模型再换 Whisper.cpp 或 Faster Whisper 后端有 N 卡先确认 GPU 加速真的生效了。老 CPU 直接报错Buzz 要求 CPU 支持 AVX2年代太老的机器可能不满足。大模型偶尔编词large 系新模型准确率最高但有时会幻听出没说的内容正式稿建议人工通读一遍。启动就崩溃多是模型文件下坏了删掉重下一次。麦克风权限之类的问题排查在 FAQ 里都有。现在就把第一段录音拖进 Buzz模型下载完逐字稿自己跑出来。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考