首页 AI音频工具 Buzz:20K Star的开源离线语音转文字工具,基于Whisper

Buzz:20K Star的开源离线语音转文字工具,基于Whisper

📅 2026/7/28 👁 阅读 6 🔗 工具访问 0 次 📂 AI音频工具

你有没有遇到过这种情况——开会录音了、上课录了音频、或者手头有一段采访录音,想转成文字。第一反应是找在线工具,但上传几十分钟的音频到云端,等半天,还担心隐私。

Buzz 就是解决这个的。一个开源的桌面应用,装在你电脑上,用 OpenAI 的 Whisper 做语音转文字和翻译,完全离线运行。

项目地址:github.com/chidiwilliams/buzz。MIT 协议,2022 年发布至今,GitHub 上已经有 20,470 个 Star,累计下载超过 121 万次。最新的 v1.4.4 版本今年 3 月刚更新。

Buzz cover

Buzz 能做什么

文件转录。 导入音频或视频文件,或者直接贴一个 YouTube 链接,Buzz 自动下载音频并转成文字。支持常见格式 MP3、WAV、M4A、MP4 等。

实时转录。 插上麦克风,Buzz 可以实时把你说的话转成文字。这个功能有一个专门的「演示窗口」模式——字体大、显示清晰,适合会议时投屏展示。

说话人分离。 多人对话的录音,Buzz 可以在转录之前做声纹分离,把不同人的话分开标注,准确率比直接转好很多。

说话人识别。 不仅能分开不同说话人,还能识别出谁是谁。如果你有固定开会的人,Buzz 可以记住他们的声音特征。

导出多种格式。 转录完成后可以导出为 TXT(纯文本)、SRT(字幕格式)、VTT(Web 字幕格式)。直接拿去给视频加字幕、做会议记录都能用。

文件夹自动转录。 设置一个「监视文件夹」,放进去的新音频文件会被自动转成文字。适合批量处理场景。

CLI 命令行。 如果你不想用图形界面,可以用命令行脚本化操作——适合写脚本批量处理。

插件系统。 可以装插件扩展功能,比如 AI 摘要生成、自动调整字幕大小等。

背后用的模型

Buzz 基于 OpenAI 的 Whisper 模型。支持多种加载方式:

Whisper(原版)——OpenAI 官方实现,精度高但速度一般。

Faster Whisper——CTranslate2 重新实现的 Whisper,速度快 4 倍,显存占用更少,是默认选项。

Whisper.cpp——C++ 实现,支持 Vulkan 加速,能在集成显卡上跑。

Hugging Face Transformer 模型——可以用社区微调过的各种 Whisper 变体。

硬件加速方面:NVIDIA 用户可以用 CUDA,Mac 用户有 Apple Silicon 原生支持,Whisper.cpp 模式下还能用 Vulkan 利用集成显卡。

怎么安装

Buzz 支持全平台,安装方式也很多样:

# macOS:从 SourceForge 下载 DMG
# Windows:从 SourceForge 下载安装包

# Linux Flatpak
flatpak install flathub io.github.chidiwilliams.Buzz

# Linux Snap
sudo snap install buzz

# PyPI(Python 用户)
pip install buzz-captions
python -m buzz

首次启动时会自动下载 Whisper 模型(约 1.5GB),下载一次之后就可以完全离线使用了。

槽点也得说

首次需要下载模型。 Whisper 模型文件很大——最小的 tiny 模型约 75MB,最大的 large 模型约 3GB。首次用要等一等。

Windows 安装包没签名。 下载后 SmartScreen 会弹警告,需要点"更多信息"→"仍要运行"。macOS 也一样没签名。

GPU 加速配置有点门槛。 如果你用 PyPI 安装想开 GPU 加速,需要手动装 CUDA 版本的 PyTorch,对非技术用户不太友好。

处理长音频慢。 几十分钟的录音转文字,用 large 模型可能要等十几分钟。如果用 tiny 模型快很多但准确率下降。用 Faster Whisper 是个好的折中。

界面偏朴实。 功能很全但 UI 设计比较朴素,没有一些付费转录工具那么精致。

跟同类一比

语音转文字工具很多,但 Buzz 有几个不可替代的优势:

完全离线。 所有处理在本地完成,不用担心录音传到第三方服务器。对于涉及敏感信息的会议录音,这是刚需。

免费开源。 市面上很多转录工具按分钟收费——Buzz 零成本。你只需要出电费。

20K Star 的社区。 4 年的持续更新、121 万次下载、24 个未结 Issue——说明项目很活跃,不会突然停更。

多后端支持。 不是绑死在一种 Whisper 实现上,你可以根据硬件情况选 fastest、most accurate 或者最省资源的方案。

一句话总结

如果你需要经常把音频转成文字——会议记录、采访整理、网课笔记、视频加字幕——Buzz 是目前最好的免费方案。没有之一。

装一个在电脑上,以后有音频要转文字,打开就能用,不花钱、不传云端、不担心隐私。

官网:chidiwilliams.github.io/buzz
GitHub:github.com/chidiwilliams/buzz
SourceForge:sourceforge.net/projects/buzz-captions

标签:#Buzz #Whisper #语音转文字 #离线转录 #开源 #AI音频 #字幕制作 #会议记录


关注我,每期分享一个帮你省事的 AI 工具 🛠️
你平时用什么工具做录音转文字?评论区聊聊 👇

💬 评论区 (0 条评论)

暂无评论,快来发表第一条评论吧!

📤 分享这篇文章

📌 相关推荐

微信扫码分享

打开微信扫一扫