语音输入的特殊性
键盘输入是经过你自我编辑的文字:你在按下按键之前,已经决定好要表达什么。语音不一样——你说出的是半成品,是带着语气词、犹豫和修正的原始思维流。一个语音输入工具每天经手的,可能是用户最不愿意被记录下来的内容。
这决定了 Ousia Voice 的第一条设计约束:默认不把声音送出设备。
本机识别已经够快
几年前,本地语音识别的准确率和速度都还不具备产品化的条件。今天情况不同了:
- FunASR、Whisper 等模型在中等规模下就能达到可用的准确率;
- Apple Silicon 与现代 x64 处理器的算力足以支撑实时转写;
- 量化与推理优化让常驻后台的内存与能耗开销降到可以接受的水平。
我们的测试里,从按下快捷键到录音状态点亮的界面响应约为 12ms;识别本身在本机完成,不需要等待网络往返。对「说完即得」的输入场景来说,本地路径在体验上反而是更快的那个。
联网能力是可选项,不是默认项
本机优先不等于拒绝云端。云端高精度识别和 AI 文字整理对复杂音频、长会议录音仍然有价值,所以它们以可选项存在:
需要时由你在设置中显式开启;不开启时,Ousia Voice 就只做本机转写。
账号系统只服务于订阅与同步,录音与转写历史默认不保存。这些规则听起来琐碎,但它们共同回答了一个问题:这个工具到底为谁工作。
工程上的代价
本机优先不是免费的。模型分发让安装包变大(当前 macOS 包约 125MB),不同芯片的性能差异需要逐一适配,离线词典与模型更新也需要单独的通道。但我们认为这是一个值得付的代价——输入法是离人最近的软件,它应该先把「信任」这件事做对。
如果你对这个方向的工程细节感兴趣,欢迎通过 support@ousiaai.com 与我们交流。