Handy:开源免费的离线语音转文字工具,按一下快捷键就能输入

平时写文档、聊天或者用 AI 的时候,我其实挺喜欢用语音输入。

特别是需要输入一大段文字时,说话通常比一个字一个字敲键盘快不少。

但语音输入有一个比较明显的问题:很多工具都需要把录音上传到云端处理。如果输入的是工作内容、代码、账号信息或者其他比较私密的内容,我还是更倾向于在本地完成。

最近发现一个开源项目 Handy。它是一款免费的、开源的语音转文字桌面工具,最大的特点就是:完全在本地进行语音识别,不需要把语音发送到外网。

项目地址:

官网:

使用方法也非常简单。

安装 Handy 后设置一个快捷键,需要输入文字时按住快捷键直接说话,松开后 Handy 就会进行语音识别,然后把转换出来的文字直接粘贴到当前正在使用的输入框里。

也就是说,无论是微信、浏览器、Word、记事本,还是 ChatGPT、Claude 之类的 AI 工具,只要是可以输入文字的地方,基本都可以直接使用。

它的整个流程可以简单理解成:按快捷键 → 说话 → 本地识别 → 自动输入文字

而且 Handy 并不是简单调用系统自带的语音输入,它本身集成了多种本地语音识别模型。

目前可以选择 Whisper 的 Small、Medium、Turbo、Large 等模型,在支持的硬件上还能使用 GPU 加速;另外还支持 Parakeet V3,这个模型针对 CPU 做了优化,即使没有独立 GPU 也可以运行。

我觉得Parakeet V3 这个选项挺实用,尤其是一些没有独立显卡的普通电脑,不一定非要为了语音输入准备一块 GPU。项目文档显示,它支持自动语言检测,并针对 CPU 场景进行了优化。

除了语音识别本身,Handy 还使用 Silero VAD 做语音活动检测,可以过滤掉一部分无声内容;项目本身采用 Tauri 架构开发,前端是 React + TypeScript,后端使用 Rust,也比较方便开发者进行二次开发。

项目也提供现成的安装包,不需要自己编译。Windows 还可以通过 winget 安装,macOS 可以通过 Homebrew 安装。

我觉得 Handy 比较适合两类人:一是经常使用语音输入的人。不需要频繁切换输入法或者打开单独的网页,设置好快捷键之后,在哪个软件里都可以直接说。二是比较在意隐私的人。录音和转写都可以在自己的电脑上完成,不需要把语音内容交给第三方云服务。

当然,本地运行 AI 语音模型也意味着会占用一定的 CPU、GPU 和内存,具体速度和效果还取决于选择的模型以及电脑配置。

如果你平时经常写东西、和 AI 聊天,或者只是想找一个免费、开源、离线的语音输入工具,Handy 可以试试。