为什么是快说
一个真正安静、离线、不抢焦点的电脑语音输入法——整天挂着,想把语音转文字的时候直接说。
按住即说,语音转文字落在光标处
按住 Ctrl+Shift+Space 说话,松手成文。识别结果走一次真实粘贴,直接落进你正在打字的窗口——微信、飞书、VS Code、浏览器地址栏都行。
会议逐字稿,自动区分说话人
会议模式只记逐字稿,一个字都不会打进你的文档。自动区分说话人,还额外录一路系统内录声音,把腾讯会议、飞书、Zoom 里对方说的话也补进来。可导出 MD / JSON。
全程离线,本地语音识别
语音识别模型跑在本机,音频和文字一个字节都不出这台机器。你的会议内容只属于你自己。
声纹过滤,只认你的声音
能量和频谱分不出人,声纹向量可以。录 3 段各 3 秒完成注册,之后只有你的声音能驱动输入——电视、视频、旁边同事的声音一律进不来。
不抢焦点悬浮条
任务栏正上方常驻一条悬浮条,永不抢走焦点——说话的时候,你原来的窗口始终是前台,识别完自然落回光标处。
Webhook 实时推送逐字稿
边开会边推给你的系统:每识别出一句就在几秒内 POST 到你的接口,带所属项目 ID,不用等散会。会议结束再推一份完整逐字稿。
装完长这样
三张真实截图:输入历史、会议逐字稿、设置。图里的深色界面就是产品本体,不是主题穿帮。
从说话到落字,五步
没有开始按钮,没有复制粘贴。整个过程发生在你按住快捷键到松手之间。
-
按住
按住 Ctrl+Shift+Space。快按一下则只听一句,说完自动停。
-
说话
悬浮条波形转绿、随声起伏;你原来打字的窗口一直是前台。
-
本机识别
SenseVoice 在这台电脑上把语音变成文字,不经过任何服务器,断网也照常识别。
-
松手落字
一次真实 Ctrl+V,文字落在光标处。Draft.js、Lexical 这类自己维护文档模型的编辑器也不会乱。
-
还回剪贴板
你之前复制的内容原样放回去——输入法不该顺手吃掉你复制的东西。
什么时候会用上
打字累、会议记不过来、内容不方便传上云——这几种时候,说比打快。
聊天与写邮件
微信、飞书、钉钉里一段话要打半天。按住说完松手,文字直接落在输入框里,不用先在别处转好再复制过来。
写文档、写代码注释
思路是连着的,手速跟不上就断了。在 Word、飞书文档、Notion、VS Code 里口述初稿,回头再改——语音输入法只负责把话变成字。
远程会议逐字稿
腾讯会议、飞书、Zoom 都行:麦克风录你,系统内录补上对方,自动区分说话人,散会就有一份能搜的会议记录转文字稿。
不能外传的内容
客户名单、薪资、病历、未公开的方案——用在线转写就等于把它们交给了别人的服务器。本地语音识别不产生这一步。
内网和没有网的地方
内网机器、飞机上、信号差的会议室,云端语音转文字全都用不了。快说的模型在本机,断网可用。
接进你自己的系统
比自己折腾 Whisper 本地部署省事:装完即用,再填个 Webhook 地址,逐字稿按句推到你的接口,纪要要怎么写交给你自己的系统。
全程离线,一个字都不上传
语音一旦要过一次服务器,密码、薪资、病历就都过了一次别人的服务器。快说的语音识别只发生在你的电脑上。
你可能想问
需要联网吗?
识别不需要。识别模型(228MB)和声纹模型(27MB)都内置在安装包里,装完即用,首次启动不用等下载。运行时也不把音频或文字发到任何服务器;唯一的外发是你在设置里自己填了 Webhook 地址时,会议逐字稿按句推送到你指定的接口。
支持哪些系统?
目前提供 Windows 和 macOS 安装包,下载区两个按钮都可用。Windows 端额外录系统声音需要 Windows 10 及以上。
识别准吗?
内置 SenseVoice 模型在本机运行,中文日常口述与会议对话都在可用水平;安静环境、贴近麦克风时效果最好。每一句在识别出的瞬间就已落盘,说得再长也不怕丢。
会议怎么区分说话人?
用你注册声纹时的那份向量,给每段话贴上「我 / 说话人1 / 说话人2」标签,可改名,改完同步重写整份稿子。远程会议还会额外录一路系统声音,单独断句、单独分说话人,并且永远不会被标成「我」。
我的数据存在哪?
全部在这台电脑上:逐字稿与输入历史在识别出的瞬间写入本地文件,没有账号、没有云端同步。不想要了,删掉文件(或卸载)就是真的没了。
快说收费吗?
免费,也不用注册账号。识别全程跑在你自己的电脑上,本就不产生云端调用费,所以没有时长、字数或次数限制。安装包在 GitHub Releases 上直接下载,源码以 MIT 协议开放。
能在微信、飞书、VS Code 里直接语音输入吗?
可以,而且不用装任何插件。快说不接管系统输入法,识别完成后走一次真实的 Ctrl+V 粘贴,所以微信、飞书、钉钉、VS Code、Word、浏览器地址栏——任何能粘贴的窗口都能用。粘完还会把你原先复制的内容还回剪贴板。
和讯飞听见、通义听悟这类在线转写有什么不同?
品类不同:它们把录音传到云端做批量转写,长音频的精度和后处理确实更强,代价是内容要离开你的电脑、并按时长计费;Windows 自带的语音输入则要联网,也不区分说话人。快说是本地实时工具,模型跑在你自己的机器上,说完当场落到光标处或写进逐字稿,断网照样能用,适合内容不方便外传的场合,比起自己折腾 Whisper 本地部署也省事得多。边界也说清楚:快说只处理实时麦克风和系统内录,不做音频文件的导入批量转写,要转已有的录音文件请用云端服务。
装完即用
免费下载,无需账号。语音识别模型与声纹模型都内置在 Windows / macOS 安装包里,不用首次启动等下载。装上,按住,说。
Linux 端提供 AppImage 与 deb 两种包,上面的按钮下载 AppImage,deb 的地址见版本说明。AppImage 需要系统装有 libfuse2(Ubuntu 22.04 起默认不带,装一下即可);Ubuntu 24.04 建议直接用 deb。首次启动会联网下载识别模型。
用着有问题,群里说
Bug 反馈、功能许愿、新版本尝鲜,都在这个群里。
微信扫码加入「快说输入法产品交流群」