语音输入
本机识别与云端转写两条路径,加上转写润色、语音学习、热词与容量上限。
主对话输入框旁的麦克风图标开始语音转写。「设置 → 语音输入」提供:转写润色(用模型润色口语转写)、语音学习(从你的修正中学习)、热词(提高特定词识别率)、语音记忆等开关。
- 两条转写路径。macOS 上优先用随应用一起装的本地识别组件(系统 ASR,在本机跑,音频不出机器);找不到它时退回云端转写接口。设置页上能看到当前是哪一条。
- 本地路径是会话式听写:一个常驻进程,音频边录边送,中途先给临时结果,单次最长 5 分钟自动收尾。开始听写时会把启用的热词一并交给识别器做提示。
- 云端路径是一次性转写:整段音频上传,单个文件上限 25MB,60 秒超时。凭据先看「设置 → 语音输入」里单独填的转写 Key,没填则借用你已配置的 OpenAI 模型的 Key;两个都没有就报缺凭据。
- 转写润色:默认开启,用轻量模型把口语顺一遍,8 秒超时;润色失败直接用原始转写,不会把上屏卡住。
- 语音学习:默认开启。它比对「识别出来的」和「你改完发出去的」,从差异里提热词和语音记忆,一轮最多各 3 条,置信度低于 0.7 的丢掉,剩下的按库自己的去重合并规则写进去。不想让它自己长就把开关关掉,存错的条目也可以在设置里删。
- 容量:热词最多 50 条、每条不超过 48 字;语音记忆最多 50 条、每条不超过 500 字。满了按最近更新时间淘汰。两者都存在
~/.klaus/settings.db。 - 排障用的历史:每次转写的「原始文本 + 润色后文本」会记进本地一张表(默认保留 30 天),这是分辨「听错了」还是「润色改错了」的唯一依据。它没有界面入口,只能从对话里问。
- 常见失败:本地识别组件不在(退回云端)、麦克风没授权、云端没凭据、网络超时。