全程离线的电脑语音输入法

说话,就成了文字离线语音输入法 · 会议逐字稿 · Windows / macOS

按住说话,松手成文——语音转文字直接落在你正在打字的地方,微信、飞书、VS Code 都能用。整场会议也能录成自动区分说话人的逐字稿。识别全程在本机完成,不联网、不上传。

WINDOWS · MACOS

会议逐字稿 · 14:02

这个版本就定在下周三上线。

说话人 1

收到,我今天把安装包和更新说明准备好。

好,散会后我把逐字稿发到你邮箱。

已粘贴到光标处
0 字节上传
不抢焦点
自动区分说话人
装完即用
01功能

为什么是快说

一个真正安静、离线、不抢焦点的电脑语音输入法——整天挂着,想把语音转文字的时候直接说。

01

按住即说,语音转文字落在光标处

按住 Ctrl+Shift+Space 说话,松手成文。识别结果走一次真实粘贴,直接落进你正在打字的窗口——微信、飞书、VS Code、浏览器地址栏都行。

02

会议逐字稿,自动区分说话人

会议模式只记逐字稿,一个字都不会打进你的文档。自动区分说话人,还额外录一路系统内录声音,把腾讯会议、飞书、Zoom 里对方说的话也补进来。可导出 MD / JSON。

03

全程离线,本地语音识别

语音识别模型跑在本机,音频和文字一个字节都不出这台机器。你的会议内容只属于你自己。

04

声纹过滤,只认你的声音

能量和频谱分不出人,声纹向量可以。录 3 段各 3 秒完成注册,之后只有你的声音能驱动输入——电视、视频、旁边同事的声音一律进不来。

05

不抢焦点悬浮条

任务栏正上方常驻一条悬浮条,永不抢走焦点——说话的时候,你原来的窗口始终是前台,识别完自然落回光标处。

06

Webhook 实时推送逐字稿

边开会边推给你的系统:每识别出一句就在几秒内 POST 到你的接口,带所属项目 ID,不用等散会。会议结束再推一份完整逐字稿。

02界面

装完长这样

三张真实截图:输入历史、会议逐字稿、设置。图里的深色界面就是产品本体,不是主题穿帮。

快说输入历史界面:离线语音转文字的每一句识别结果按时间列出,可复制、可检索
输入历史 · 每句话识别出的瞬间就已落盘
快说会议模式界面:自动区分说话人的会议逐字稿,可导出 MD / JSON 并按句推送 Webhook
会议逐字稿 · 自动区分说话人,导出 MD / JSON
快说设置页:Ctrl+Shift+Space 快捷键、声纹注册与系统内录等离线语音输入选项
设置 · 快捷键、声纹注册、系统内录开关
03工作方式

从说话到落字,五步

没有开始按钮,没有复制粘贴。整个过程发生在你按住快捷键到松手之间。

  1. 按住

    按住 Ctrl+Shift+Space。快按一下则只听一句,说完自动停。

  2. 说话

    悬浮条波形转绿、随声起伏;你原来打字的窗口一直是前台。

  3. 本机识别

    SenseVoice 在这台电脑上把语音变成文字,不经过任何服务器,断网也照常识别。

  4. 松手落字

    一次真实 Ctrl+V,文字落在光标处。Draft.js、Lexical 这类自己维护文档模型的编辑器也不会乱。

  5. 还回剪贴板

    你之前复制的内容原样放回去——输入法不该顺手吃掉你复制的东西。

04使用场景

什么时候会用上

打字累、会议记不过来、内容不方便传上云——这几种时候,说比打快。

01

聊天与写邮件

微信、飞书、钉钉里一段话要打半天。按住说完松手,文字直接落在输入框里,不用先在别处转好再复制过来。

02

写文档、写代码注释

思路是连着的,手速跟不上就断了。在 Word、飞书文档、Notion、VS Code 里口述初稿,回头再改——语音输入法只负责把话变成字。

03

远程会议逐字稿

腾讯会议、飞书、Zoom 都行:麦克风录你,系统内录补上对方,自动区分说话人,散会就有一份能搜的会议记录转文字稿。

04

不能外传的内容

客户名单、薪资、病历、未公开的方案——用在线转写就等于把它们交给了别人的服务器。本地语音识别不产生这一步。

05

内网和没有网的地方

内网机器、飞机上、信号差的会议室,云端语音转文字全都用不了。快说的模型在本机,断网可用。

06

接进你自己的系统

比自己折腾 Whisper 本地部署省事:装完即用,再填个 Webhook 地址,逐字稿按句推到你的接口,纪要要怎么写交给你自己的系统。

05隐私

全程离线,一个字都不上传

语音一旦要过一次服务器,密码、薪资、病历就都过了一次别人的服务器。快说的语音识别只发生在你的电脑上。

01 说话 麦克风拾音,先过声纹校验:不是你的声音,一律进不来。
02 本机识别 SenseVoice-Small 在这台电脑上运行,音频不出这台机器。
03 文字落盘 每句话在识别出的那一瞬间写入本地文件——崩溃、断电、强杀,最多丢掉正在写的那一行。
0 字节上传 没有账号 · 没有云端 · 没有遥测
06常见问题

你可能想问

需要联网吗?

识别不需要。识别模型(228MB)和声纹模型(27MB)都内置在安装包里,装完即用,首次启动不用等下载。运行时也不把音频或文字发到任何服务器;唯一的外发是你在设置里自己填了 Webhook 地址时,会议逐字稿按句推送到你指定的接口。

支持哪些系统?

目前提供 Windows 和 macOS 安装包,下载区两个按钮都可用。Windows 端额外录系统声音需要 Windows 10 及以上。

识别准吗?

内置 SenseVoice 模型在本机运行,中文日常口述与会议对话都在可用水平;安静环境、贴近麦克风时效果最好。每一句在识别出的瞬间就已落盘,说得再长也不怕丢。

会议怎么区分说话人?

用你注册声纹时的那份向量,给每段话贴上「我 / 说话人1 / 说话人2」标签,可改名,改完同步重写整份稿子。远程会议还会额外录一路系统声音,单独断句、单独分说话人,并且永远不会被标成「我」。

我的数据存在哪?

全部在这台电脑上:逐字稿与输入历史在识别出的瞬间写入本地文件,没有账号、没有云端同步。不想要了,删掉文件(或卸载)就是真的没了。

快说收费吗?

免费,也不用注册账号。识别全程跑在你自己的电脑上,本就不产生云端调用费,所以没有时长、字数或次数限制。安装包在 GitHub Releases 上直接下载,源码以 MIT 协议开放。

能在微信、飞书、VS Code 里直接语音输入吗?

可以,而且不用装任何插件。快说不接管系统输入法,识别完成后走一次真实的 Ctrl+V 粘贴,所以微信、飞书、钉钉、VS Code、Word、浏览器地址栏——任何能粘贴的窗口都能用。粘完还会把你原先复制的内容还回剪贴板。

和讯飞听见、通义听悟这类在线转写有什么不同?

品类不同:它们把录音传到云端做批量转写,长音频的精度和后处理确实更强,代价是内容要离开你的电脑、并按时长计费;Windows 自带的语音输入则要联网,也不区分说话人。快说是本地实时工具,模型跑在你自己的机器上,说完当场落到光标处或写进逐字稿,断网照样能用,适合内容不方便外传的场合,比起自己折腾 Whisper 本地部署也省事得多。边界也说清楚:快说只处理实时麦克风和系统内录,不做音频文件的导入批量转写,要转已有的录音文件请用云端服务。

07下载

装完即用

免费下载,无需账号。语音识别模型与声纹模型都内置在 Windows / macOS 安装包里,不用首次启动等下载。装上,按住,说。

最新版本
检查中

Linux 端提供 AppImage 与 deb 两种包,上面的按钮下载 AppImage,deb 的地址见版本说明。AppImage 需要系统装有 libfuse2(Ubuntu 22.04 起默认不带,装一下即可);Ubuntu 24.04 建议直接用 deb。首次启动会联网下载识别模型。

08交流群

用着有问题,群里说

Bug 反馈、功能许愿、新版本尝鲜,都在这个群里。

快说离线语音输入法产品交流群二维码

微信扫码加入「快说输入法产品交流群」