对于正在寻找系统级语音输入功能的 Linux 用户来说,Vocalinux 提供了一个全新的开源选择。这是一款注重隐私的听写应用,能够将你口述的文字直接输入到当前聚焦的桌面应用程序中。
🎙️ 后台运行,无缝输入
与独立的转录工具不同,Vocalinux 在后台运行,并通过可配置的键盘快捷键激活。你可以切换录音模式或使用“按住说话”(Push-to-Talk),对着麦克风说话,文字就会自动输入到浏览器、文本编辑器、办公软件、终端、即时通讯客户端或其他活动文本框中。
🛡️ 本地处理,无需联网
虽然工作流程类似于 Windows 和 macOS 内置的语音输入,但 Vocalinux 专为 Linux 开发,默认在本地处理语音。无需注册账户、订阅或连接云服务,麦克风录音完全保留在本地计算机上。

Vocalinux 的系统托盘图标会显示空闲、监听和处理状态。
🖥️ 兼容 X11 与 Wayland
该应用支持 X11 和 Wayland 会话。由于 Wayland 出于设计原因限制了应用程序模拟键盘输入的能力,Linux 下的文本注入在这两种显示系统间存在显著差异,但 Vocalinux 已对此进行了适配。
🧠 多种本地语音识别后端
Vocalinux 支持三种本地语音识别后端:whisper.cpp、OpenAI Whisper 和 VOSK。默认引擎是 whisper.cpp,它提供了 Whisper 语音识别模型的优化原生实现。用户也可以根据硬件、首选语言或性能要求选择其他后端。
⚡ 离线工作与 GPU 加速
语音识别模型直接在用户系统上运行,一旦下载了组件和模型,Vocalinux 即可在离线状态下工作。如果系统 GPU 支持,应用还可利用 Vulkan 加速,让语音识别在 AMD、Intel 和 NVIDIA 显卡上运行,而非仅依赖处理器。硬件较弱的用户可以选择较小的识别模型,以牺牲少量精度换取更低的资源占用和更快的转录速度。
⌨️ 灵活的快捷键与设置
除了核心听写功能,Vocalinux 还包含系统托盘图标、可配置的音频提示、开机自启支持、图形化设置界面以及可自定义的键盘快捷键。快捷键处理支持非美式键盘布局,两种激活模式让用户可以在“双击组合键”和“按住说话”之间自由选择。
🌐 可选的远程模式
虽然 Vocalinux 优先支持离线,但也包含可选的远程模式。用户无需将音频发送给商业提供商,而是可以将应用指向自己运营的转录服务器。支持的选项包括兼容 OpenAI 的 HTTP 端点和 whisper.cpp 提供的服务器实现,通过兼容的服务器配置,还可以使用 FunASR 和 SenseVoice 等其他引擎。
📥 安装方式
安装可通过项目的交互式 Shell 安装程序进行,支持 Ubuntu、Debian、Fedora、Arch 和 openSUSE 等主流 Linux 发行版。此外,Vocalinux 也通过 Flatpak 和 Arch AUR 提供分发。
截至撰写本文时,最新版本为 Vocalinux 0.14.2。更多详情,请访问 项目官网 或 GitHub 仓库。