本地语音输入
是什么
桌面端的语音输入完全在本机完成:你自选一款开源语音识别模型下载到本地,之后录音与识别全程离线,语音不会上传(底层为 sherpa-onnx / ONNX Runtime)。网页端则降级使用浏览器自带的 Web Speech API(走浏览器厂商的识别服务),不支持的环境会明确提示。
可选模型(在「本地语音模型」面板中二选一或都下载):
| 模型 | 说明 | 体积 |
|---|---|---|
| SenseVoice 多语版(推荐) | 中文效果最好,支持中英日韩粤混说,带标点 | 约 163 MB |
| Paraformer 中文轻量版 | 体积小一半,中文专用,识别更快 | 约 78 MB |
怎么用
- 打开对话输入框,点击麦克风按钮。
- 首次使用会弹出「本地语音模型」面板:选择一款模型点击下载,面板中实时显示下载进度。
- 下载完成后,点麦克风开始录音,说完再点一次结束(界面提示「正在录音,点击麦克风结束」)。
- 识别结果显示为文字,直接进入输入框,可编辑后再发送。
模型下载到本机数据目录的 asr-models/ 下,之后无需联网即可使用;已下载的模型也可以在面板中删除。
场景
- 长口述输入:会议灵感、读书笔记口播成文,比打字快得多。
- 离线环境:无网/弱网环境下照常语音输入,因为识别不依赖任何云服务。
- 语音隐私敏感:访谈、病历、内部讨论等不方便上传第三方语音接口的内容。
注意事项
- 模型哈希校验:下载的模型包会做 sha256 钉死校验,校验不通过视为下载被篡改或损坏,拒绝解包使用——遇到校验失败删除后重新下载即可。
- 首次下载需要联网(模型托管在 sherpa-onnx 官方发布渠道),下载完成后识别完全离线。
- 麦克风权限需在操作系统层面授权;被拒绝时会提示「麦克风不可用,请在系统设置中授权」。
- 首次识别某个模型时会有短暂的模型加载时间,之后保持常驻,识别更快。
- 网页端的 Web Speech API 由浏览器实现,识别会经过浏览器厂商的服务,与桌面端的离线口径不同。
FAQ
两款模型怎么选?
默认选 SenseVoice 多语版:中文效果最好、自动带标点、支持中英日韩粤混说。磁盘紧张或只需要中文短句时选 Paraformer 中文轻量版。
下载的模型占多少空间?能删吗?
SenseVoice 约 163 MB,Paraformer 约 78 MB,都在数据目录 asr-models/ 下,可在模型面板中删除,删除后语音输入功能回到「待下载」状态。
识别不准怎么办?
确认环境噪音和麦克风质量;中英文混杂场景优先用 SenseVoice。识别结果会先进输入框而不是直接发送,可以手动修正后再提交。
为什么网页端不是离线的?
网页端依赖浏览器内置的 Web Speech API,它本身由浏览器厂商提供(多数实现在云端识别)。需要离线语音输入请使用桌面端。