按住 RightCtrl 说话,松手,文字落到任何程序的光标处。识别引擎、AI 润色、热词纠错全部由你定义,也可以完全离线、不联网、零密钥。
Windows 10/11 x64 · MIT 开源 · macOS 版开发中 · 更新说明与历史版本
为什么是 SpeakType
市面上的 AI 语音输入要么闭源,要么把你的语音送进厂商自己的服务器。SpeakType 干脆没有服务器——语音只发去你指定的地方,或者根本不出这台电脑。
协议、纠错算法、界面,每一行都能看、能改、能自部署。不埋点、不注册、不上传统计。
我们不架设任何云服务。语音只发给你自己选择并配置的识别服务——或者完全留在本机。
识别引擎、润色模型、热词词典、人设风格、快捷键,随便换,包括换成本地 Ollama。
落字后你在原输入框手改对的词,它会自己发现并学进词典,同样的错不会再犯第二次。
台式机没麦克风?扫码用手机说话,文字落到电脑光标处。同一 Wi-Fi 走局域网直连,异地走可自部署的中转——这一条同类产品里没人做。
简体中文、繁體中文、English、日本語、한국어,跟随系统或手动切换,即时生效。
一分钟上手
装安装版,或者直接用绿色免安装版——配置就存在 exe 旁边。
设置 → 语音识别 → 内置离线模型一键下载,或者填你自己的 API Key。
光标放进任何输入框,按住 RightCtrl(也可设成鼠标侧键)说话,松手落字。
你手改一个词,它就学进词典,用得越久越准。
识别引擎
自带 key、复用自己的账号,或者什么都不用带。
应用内一键下载:中文推荐 SenseVoice-Small(实测每句 0.27 秒、自带标点),或多语言的 whisper.cpp(tiny/base/small)。不联网、不注册、零密钥。
填 Base URL + Key + 模型名,带测试连接。内置 OpenAI Whisper、Groq(有免费额度)、Fireworks、Mistral Voxtral、SiliconFlow、阿里云百炼预设。
润色可接任意 OpenAI 兼容 Chat 端点:OpenAI、Gemini 的兼容端点、Groq、DeepSeek、智谱 GLM-4-Flash、Kimi、通义,或本地 Ollama。不配置也不影响使用——本地会做口语清理(如「5 点,不对,6 点」→「6 点」)。
词典里加上人名、产品名,同音/近音误字在本机按拼音修好,不用等模型。
如实对比
这个赛道有很多好产品。下面写清楚我们真正不一样的地方,也写清楚我们还没做到的地方。
| SpeakType | 闭源订阅制产品 | 纯离线开源工具 | |
|---|---|---|---|
| 开源 | 全部 MIT | 否 | 一般是 |
| 价格 | 免费 | 约 10–15 美元 / 月 | 免费 |
| 可完全离线 | 可以 | 不行 | 可以 |
| 想用云模型时 | 任意 OpenAI 兼容接口 | 只能用厂商自己的 | 大多不支持 |
| 手机当麦克风 | 扫码即用 | 没有 | 没有 |
| 学你手改的词 | 自动 | 少见 | 没有 |
| 中文同音纠错 | 内置 | 看情况 | 看情况 |
| macOS / Linux | 开发中 | 一般都有 | 大多有 |
下载
安装包未做商业签名,SmartScreen 拦截时点「更多信息 → 仍要运行」。
常见问题
只发给你自己配置的识别服务。用内置离线模型时不出本机——SpeakType 没有服务器,也不收集任何统计。密钥、历史、失败录音都只存在 %APPDATA%\SpeakType。
不需要。默认路径就是应用内一键下载的离线模型。Key 是给想要云端速度/准确率的人的可选项。
任何有文本光标的 Windows 程序:浏览器、编辑器、IDE、聊天软件、Office,落字方式与粘贴等价。
能。设置 → 通用 → 点「录一个键」,按任意键或鼠标侧键即可。长段输入可以用免按模式(Alt+Q),说完自动结束。
落字后它只盯着那一个输入框(Windows UI Automation)。你改了字,它在本机比对差异,把改对的词学进词典并同步修正历史记录;你切到别的窗口就停止观察。比对全程不出本机,也可以在设置里整块关掉。
它复用你自己登录的会话,调用的是对方没有公开的接口,可能失效,也可能与对方服务条款冲突,账号风险由你自行判断,默认是关闭的。介意的话请用离线模型或自带 API Key。完整免责说明。
平台抽象层已合并、DMG 打包配置也在了,只差一台 macOS 构建机。欢迎贡献。