[Github] Handy – 完全离线的开源跨应用语音输入工具

Github发现2026-07-15发布 WarpEdit
122 1 0

Handy 是一款面向桌面的开源语音输入工具:按下快捷键说话,松开后在本机完成识别,再把结果写入当前文本框。它支持 Windows、macOS 与 Linux,并提供 Whisper 与 Parakeet 等本地模型,适合不希望把录音发送到云端、又想在笔记、文档、聊天和浏览器之间统一使用语音输入的人。

[Github] Handy - 完全离线的开源跨应用语音输入工具

快速结论

项目 当前情况 选择建议
定位 离线语音转文字与跨应用输入 适合重视隐私、经常输入长文本的人
当前版本 v0.9.2,2026 年 7 月 12 日发布 升级前仍应查看 Release 说明
平台 Windows x64、macOS Intel/Apple Silicon、Linux x64 Linux 用户需重点核对显示服务器和依赖
开源许可 MIT;名称、Logo、图标等品牌资产不在开源范围 二次分发需使用自有品牌
主要限制 速度与准确率取决于模型和硬件,部分环境存在崩溃或粘贴问题 先用短录音测试再投入日常工作

截至 2026 年 7 月 15 日核对时,GitHub 页面显示 26,547 Stars2,289 Forks;最新正式版为 v0.9.2,主分支最近提交日期为 2026 年 7 月 12 日。仓库仍有近期维护,但项目 README 也明确列出若干已知问题。

项目概览

Handy 的工作流很直接:用户通过可配置快捷键开始或结束录音,Silero VAD 负责过滤静音,随后由本地语音模型生成文本,最后粘贴到当前应用。整个识别过程可以留在设备上,不需要把声音上传到云端。

项目使用 Tauri 构建桌面应用,界面采用 React 与 TypeScript,系统集成和音频处理主要由 Rust 完成。它还提供启动隐藏、取消识别、切换转写等命令行参数,便于与桌面快捷键或自动化工具组合。

核心功能

本地转写

Handy 支持多种 Whisper 模型,并在硬件允许时使用 GPU 加速;也支持更偏向 CPU 运行的 Parakeet V3。不同模型的文件体积、速度、语言覆盖和准确率不同,首次使用需要下载模型,因此受限网络环境可能需要手动放置模型文件。

跨应用输入

识别完成后,Handy 会把文本送入当前获得焦点的输入位置,因此不局限于某个编辑器。它适合在邮件、聊天、笔记和浏览器表单中快速输入,但无障碍权限、剪贴板行为和窗口焦点都会影响结果。

快捷控制

用户可以配置按下说话或切换式录音,也能通过命令行控制已经运行的实例。macOS 还可配合 Raycast 扩展管理录音、历史、词典和模型;这些外部集成需要单独安装和维护。

安装方式

最稳妥的方式是从官方 Release 页面或项目网站下载安装包。macOS 可通过 Homebrew Cask、Windows 可通过 winget 安装,但 README 明确说明这两个软件包并非由 Handy 开发者维护;重视来源一致性时,应优先下载官方 Release 资产并核对对应签名文件。

首次启动通常需要授予麦克风和辅助功能权限,然后下载或选择本地模型。Whisper 大模型会占用更多磁盘与内存,较老设备可以先尝试较小模型或 CPU 友好的 Parakeet,再根据延迟与准确率调整。

使用边界

“完全离线”描述的是语音识别过程,不代表安装、模型下载和更新也不需要网络。项目还说明部分 Windows 与 Linux 配置可能发生 Whisper 模型崩溃;Linux Wayland 的文本写入支持有限,通常需要 wtype、dotool 等额外工具。

在 Linux 上,录音浮层可能抢占焦点,导致转写结果粘贴到错误窗口或无法粘贴;README 建议必要时关闭浮层。语音输入涉及敏感内容时,还应检查转写历史、系统剪贴板、调试日志和本地磁盘的保护方式。

适合人群

  • 希望在多个桌面应用中使用统一语音输入的人。
  • 不愿把工作内容、会议片段或个人语音交给云端识别的用户。
  • 愿意按设备性能选择模型、处理权限与快捷键的进阶用户。
  • 需要可查看源码、可扩展语音输入基础的开发者。

如果你需要实时会议协作、云端团队词库、专业字幕校对或手机端原生体验,Handy 可能不如成熟商业服务完整。低配置设备也应先测试延迟和模型占用。

常见问题

Handy 免费吗

软件代码采用 MIT 许可证,可免费使用、研究和修改。但 Handy 的名称、Logo、图标和品牌资产不属于开源内容,制作非官方分支或重新分发时必须使用自己的品牌,不能暗示获得官方认可。

是否需要联网

日常语音识别可以完全在本机进行,不需要把录音上传到云端。首次下载应用、模型和更新仍需要网络;处于代理或防火墙环境时,可以按照 README 的目录说明手动安装模型。

支持中文吗

是否支持中文主要取决于所选模型。Whisper 系列覆盖多语言,项目也持续调整简繁中文转换相关行为。实际准确率会受口音、麦克风、环境噪声、模型大小和设备性能影响,建议用自己的语料测试。

Linux 能用吗

可以,但 Linux 的显示服务器、桌面环境和文本输入工具差异较大。X11 通常需要 xdotool,Wayland 可尝试 wtype 或 dotool;部分系统还需要安装 gtk-layer-shell,并可能要关闭录音浮层。

录音会上传吗

按项目说明,转写在本地完成,不会把录音发送到云端。为了完整保护隐私,仍需检查设备磁盘加密、转写历史、剪贴板、应用日志和第三方扩展,因为这些本地环节不等同于“自动加密”。

总结建议

Handy 的价值在于把离线语音识别做成一个跨应用输入入口,而不是只提供单独的转写窗口。Windows 和 macOS 用户可以先安装小模型测试快捷键、延迟与准确率;Linux 用户应先核对 Wayland/X11、依赖和粘贴行为。正式输入敏感内容前,再确认历史记录与本地存储策略。

相关链接

  • GitHub 仓库:cjpais/Handy
  • 项目网站:https://handy.computer
  • 最新 Release:https://github.com/cjpais/Handy/releases/latest
© 版权声明

相关文章

1 条评论

  • MetArt
    MetArt 游客

    Great post,Thanks for sharing

    回复