Handy 是一款面向桌面的开源语音输入工具:按下快捷键说话,松开后在本机完成识别,再把结果写入当前文本框。它支持 Windows、macOS 与 Linux,并提供 Whisper 与 Parakeet 等本地模型,适合不希望把录音发送到云端、又想在笔记、文档、聊天和浏览器之间统一使用语音输入的人。
![[Github] Handy - 完全离线的开源跨应用语音输入工具](https://wn.zmoyun.com/wp-content/uploads/2026/07/1784094152-handy-featured.webp)
快速结论
| 项目 | 当前情况 | 选择建议 |
|---|---|---|
| 定位 | 离线语音转文字与跨应用输入 | 适合重视隐私、经常输入长文本的人 |
| 当前版本 | v0.9.2,2026 年 7 月 12 日发布 | 升级前仍应查看 Release 说明 |
| 平台 | Windows x64、macOS Intel/Apple Silicon、Linux x64 | Linux 用户需重点核对显示服务器和依赖 |
| 开源许可 | MIT;名称、Logo、图标等品牌资产不在开源范围 | 二次分发需使用自有品牌 |
| 主要限制 | 速度与准确率取决于模型和硬件,部分环境存在崩溃或粘贴问题 | 先用短录音测试再投入日常工作 |
截至 2026 年 7 月 15 日核对时,GitHub 页面显示 26,547 Stars、2,289 Forks;最新正式版为 v0.9.2,主分支最近提交日期为 2026 年 7 月 12 日。仓库仍有近期维护,但项目 README 也明确列出若干已知问题。
项目概览
Handy 的工作流很直接:用户通过可配置快捷键开始或结束录音,Silero VAD 负责过滤静音,随后由本地语音模型生成文本,最后粘贴到当前应用。整个识别过程可以留在设备上,不需要把声音上传到云端。
项目使用 Tauri 构建桌面应用,界面采用 React 与 TypeScript,系统集成和音频处理主要由 Rust 完成。它还提供启动隐藏、取消识别、切换转写等命令行参数,便于与桌面快捷键或自动化工具组合。
核心功能
本地转写
Handy 支持多种 Whisper 模型,并在硬件允许时使用 GPU 加速;也支持更偏向 CPU 运行的 Parakeet V3。不同模型的文件体积、速度、语言覆盖和准确率不同,首次使用需要下载模型,因此受限网络环境可能需要手动放置模型文件。
跨应用输入
识别完成后,Handy 会把文本送入当前获得焦点的输入位置,因此不局限于某个编辑器。它适合在邮件、聊天、笔记和浏览器表单中快速输入,但无障碍权限、剪贴板行为和窗口焦点都会影响结果。
快捷控制
用户可以配置按下说话或切换式录音,也能通过命令行控制已经运行的实例。macOS 还可配合 Raycast 扩展管理录音、历史、词典和模型;这些外部集成需要单独安装和维护。
安装方式
最稳妥的方式是从官方 Release 页面或项目网站下载安装包。macOS 可通过 Homebrew Cask、Windows 可通过 winget 安装,但 README 明确说明这两个软件包并非由 Handy 开发者维护;重视来源一致性时,应优先下载官方 Release 资产并核对对应签名文件。
首次启动通常需要授予麦克风和辅助功能权限,然后下载或选择本地模型。Whisper 大模型会占用更多磁盘与内存,较老设备可以先尝试较小模型或 CPU 友好的 Parakeet,再根据延迟与准确率调整。
使用边界
“完全离线”描述的是语音识别过程,不代表安装、模型下载和更新也不需要网络。项目还说明部分 Windows 与 Linux 配置可能发生 Whisper 模型崩溃;Linux Wayland 的文本写入支持有限,通常需要 wtype、dotool 等额外工具。
在 Linux 上,录音浮层可能抢占焦点,导致转写结果粘贴到错误窗口或无法粘贴;README 建议必要时关闭浮层。语音输入涉及敏感内容时,还应检查转写历史、系统剪贴板、调试日志和本地磁盘的保护方式。
适合人群
- 希望在多个桌面应用中使用统一语音输入的人。
- 不愿把工作内容、会议片段或个人语音交给云端识别的用户。
- 愿意按设备性能选择模型、处理权限与快捷键的进阶用户。
- 需要可查看源码、可扩展语音输入基础的开发者。
如果你需要实时会议协作、云端团队词库、专业字幕校对或手机端原生体验,Handy 可能不如成熟商业服务完整。低配置设备也应先测试延迟和模型占用。
常见问题
Handy 免费吗
软件代码采用 MIT 许可证,可免费使用、研究和修改。但 Handy 的名称、Logo、图标和品牌资产不属于开源内容,制作非官方分支或重新分发时必须使用自己的品牌,不能暗示获得官方认可。
是否需要联网
日常语音识别可以完全在本机进行,不需要把录音上传到云端。首次下载应用、模型和更新仍需要网络;处于代理或防火墙环境时,可以按照 README 的目录说明手动安装模型。
支持中文吗
是否支持中文主要取决于所选模型。Whisper 系列覆盖多语言,项目也持续调整简繁中文转换相关行为。实际准确率会受口音、麦克风、环境噪声、模型大小和设备性能影响,建议用自己的语料测试。
Linux 能用吗
可以,但 Linux 的显示服务器、桌面环境和文本输入工具差异较大。X11 通常需要 xdotool,Wayland 可尝试 wtype 或 dotool;部分系统还需要安装 gtk-layer-shell,并可能要关闭录音浮层。
录音会上传吗
按项目说明,转写在本地完成,不会把录音发送到云端。为了完整保护隐私,仍需检查设备磁盘加密、转写历史、剪贴板、应用日志和第三方扩展,因为这些本地环节不等同于“自动加密”。
总结建议
Handy 的价值在于把离线语音识别做成一个跨应用输入入口,而不是只提供单独的转写窗口。Windows 和 macOS 用户可以先安装小模型测试快捷键、延迟与准确率;Linux 用户应先核对 Wayland/X11、依赖和粘贴行为。正式输入敏感内容前,再确认历史记录与本地存储策略。
相关链接
- GitHub 仓库:cjpais/Handy
- 项目网站:https://handy.computer
- 最新 Release:https://github.com/cjpais/Handy/releases/latest
© 版权声明
本站部分内容源于网络收集,文章等版权归原作者所有,若需删稿请联系管理员邮箱:satomini@warpnav.com
Great post,Thanks for sharing