v0.9.2 已发布 —— 你手改一次,它就记住一辈子

你说,
它写。

按住 RightCtrl 说话,松手,文字落到任何程序的光标处。识别引擎、AI 润色、热词纠错全部由你定义,也可以完全离线、不联网、零密钥。

Windows 10/11 x64 · MIT 开源 · macOS 版开发中 · 更新说明与历史版本

SpeakType 主界面

为什么是 SpeakType

属于你自己的语音输入

市面上的 AI 语音输入要么闭源,要么把你的语音送进厂商自己的服务器。SpeakType 干脆没有服务器——语音只发去你指定的地方,或者根本不出这台电脑。

完全开源(MIT)

协议、纠错算法、界面,每一行都能看、能改、能自部署。不埋点、不注册、不上传统计。

没有自己的后端

我们不架设任何云服务。语音只发给你自己选择并配置的识别服务——或者完全留在本机。

一切可插拔

识别引擎、润色模型、热词词典、人设风格、快捷键,随便换,包括换成本地 Ollama。

越用越准

落字后你在原输入框手改对的词,它会自己发现并学进词典,同样的错不会再犯第二次。

手机当麦克风

台式机没麦克风?扫码用手机说话,文字落到电脑光标处。同一 Wi-Fi 走局域网直连,异地走可自部署的中转——这一条同类产品里没人做。

5 种界面语言

简体中文、繁體中文、English、日本語、한국어,跟随系统或手动切换,即时生效。

一分钟上手

从下载到开口就写

安装

装安装版,或者直接用绿色免安装版——配置就存在 exe 旁边。

选引擎

设置 → 语音识别 → 内置离线模型一键下载,或者填你自己的 API Key。

按住说话

光标放进任何输入框,按住 RightCtrl(也可设成鼠标侧键)说话,松手落字。

它会学

你手改一个词,它就学进词典,用得越久越准。

识别引擎

三条路,随时切换

自带 key、复用自己的账号,或者什么都不用带。

默认推荐 · 完全离线

内置离线模型

应用内一键下载:中文推荐 SenseVoice-Small(实测每句 0.27 秒、自带标点),或多语言的 whisper.cpp(tiny/base/small)。不联网、不注册、零密钥。

自带 Key

任意 OpenAI 兼容接口

填 Base URL + Key + 模型名,带测试连接。内置 OpenAI Whisper、Groq(有免费额度)、Fireworks、Mistral Voxtral、SiliconFlow、阿里云百炼预设。

免密钥

网页会话通道

在应用内登录一次 ChatGPT(免费账号也能用)或豆包,就用你自己的会话转写。走的是非公开接口,默认关闭,可能失效或与对方条款冲突,请先看免责说明

AI 润色

任意 Chat 模型,或者不用

润色可接任意 OpenAI 兼容 Chat 端点:OpenAI、Gemini 的兼容端点、Groq、DeepSeek、智谱 GLM-4-Flash、Kimi、通义,或本地 Ollama。不配置也不影响使用——本地会做口语清理(如「5 点,不对,6 点」→「6 点」)。

中文优先

热词与同音纠错

词典里加上人名、产品名,同音/近音误字在本机按拼音修好,不用等模型。

识别引擎设置

同类产品里没人做

手机就是麦克风

台式机没麦克风,或者笔记本的麦全是风扇噪音?扫一下电脑上的二维码,在手机上按住说话,文字直接落到电脑光标处。同一 Wi-Fi 走局域网直连;不在一起就走中转,一条命令部署到你自己的 Cloudflare 账号。安卓 APK 和可安装到桌面的网页版都有。

如实对比

我们和别人的差别

这个赛道有很多好产品。下面写清楚我们真正不一样的地方,也写清楚我们还没做到的地方。

 SpeakType闭源订阅制产品纯离线开源工具
开源全部 MIT一般是
价格免费约 10–15 美元 / 月免费
可完全离线可以不行可以
想用云模型时任意 OpenAI 兼容接口只能用厂商自己的大多不支持
手机当麦克风扫码即用没有没有
学你手改的词自动少见没有
中文同音纠错内置看情况看情况
macOS / Linux开发中一般都有大多有

下载

获取 SpeakType v0.9.2

安装包未做商业签名,SmartScreen 拦截时点「更多信息 → 仍要运行」。

Windows 安装版

Windows 10/11 x64 · 约 98MB · 带开始菜单快捷方式,可选开机自启。

⬇ SpeakType-Setup-0.9.2.exe

绿色免安装版

解压即用,配置存在 exe 旁边 · 约 87MB。

⬇ 免安装 .exe

安卓麦克风 App

把手机变成电脑端的麦克风;也可以直接把网页添加到手机主屏幕当 App 用。

⬇ SpeakType-0.9.0.apk

macOS

平台适配层已合并,DMG 还缺一台 macOS 构建机。关注仓库获取进展。

在 GitHub 关注

常见问题

大家最常问的几个

我的语音会被上传吗?

只发给你自己配置的识别服务。用内置离线模型时不出本机——SpeakType 没有服务器,也不收集任何统计。密钥、历史、失败录音都只存在 %APPDATA%\SpeakType

必须有 API Key 吗?

不需要。默认路径就是应用内一键下载的离线模型。Key 是给想要云端速度/准确率的人的可选项。

能往哪些程序里落字?

任何有文本光标的 Windows 程序:浏览器、编辑器、IDE、聊天软件、Office,落字方式与粘贴等价。

热键能改吗?

能。设置 → 通用 → 点「录一个键」,按任意键或鼠标侧键即可。长段输入可以用免按模式(Alt+Q),说完自动结束。

「学你手改的词」是怎么做的?

落字后它只盯着那一个输入框(Windows UI Automation)。你改了字,它在本机比对差异,把改对的词学进词典并同步修正历史记录;你切到别的窗口就停止观察。比对全程不出本机,也可以在设置里整块关掉。

ChatGPT / 豆包 那条通道有风险吗?

它复用你自己登录的会话,调用的是对方没有公开的接口,可能失效,也可能与对方服务条款冲突,账号风险由你自行判断,默认是关闭的。介意的话请用离线模型或自带 API Key。完整免责说明

macOS / Linux 呢?

平台抽象层已合并、DMG 打包配置也在了,只差一台 macOS 构建机。欢迎贡献。

能说的,就别再敲了。

免费、开源、不回传。