Skip to content

本地语音输入

是什么

桌面端的语音输入完全在本机完成:你自选一款开源语音识别模型下载到本地,之后录音与识别全程离线,语音不会上传(底层为 sherpa-onnx / ONNX Runtime)。网页端则降级使用浏览器自带的 Web Speech API(走浏览器厂商的识别服务),不支持的环境会明确提示。

可选模型(在「本地语音模型」面板中二选一或都下载):

模型说明体积
SenseVoice 多语版(推荐)中文效果最好,支持中英日韩粤混说,带标点约 163 MB
Paraformer 中文轻量版体积小一半,中文专用,识别更快约 78 MB

怎么用

  1. 打开对话输入框,点击麦克风按钮
  2. 首次使用会弹出「本地语音模型」面板:选择一款模型点击下载,面板中实时显示下载进度。
  3. 下载完成后,点麦克风开始录音,说完再点一次结束(界面提示「正在录音,点击麦克风结束」)。
  4. 识别结果显示为文字,直接进入输入框,可编辑后再发送。

模型下载到本机数据目录的 asr-models/ 下,之后无需联网即可使用;已下载的模型也可以在面板中删除。

场景

  • 长口述输入:会议灵感、读书笔记口播成文,比打字快得多。
  • 离线环境:无网/弱网环境下照常语音输入,因为识别不依赖任何云服务。
  • 语音隐私敏感:访谈、病历、内部讨论等不方便上传第三方语音接口的内容。

注意事项

  • 模型哈希校验:下载的模型包会做 sha256 钉死校验,校验不通过视为下载被篡改或损坏,拒绝解包使用——遇到校验失败删除后重新下载即可。
  • 首次下载需要联网(模型托管在 sherpa-onnx 官方发布渠道),下载完成后识别完全离线。
  • 麦克风权限需在操作系统层面授权;被拒绝时会提示「麦克风不可用,请在系统设置中授权」。
  • 首次识别某个模型时会有短暂的模型加载时间,之后保持常驻,识别更快。
  • 网页端的 Web Speech API 由浏览器实现,识别会经过浏览器厂商的服务,与桌面端的离线口径不同。

FAQ

两款模型怎么选?

默认选 SenseVoice 多语版:中文效果最好、自动带标点、支持中英日韩粤混说。磁盘紧张或只需要中文短句时选 Paraformer 中文轻量版。

下载的模型占多少空间?能删吗?

SenseVoice 约 163 MB,Paraformer 约 78 MB,都在数据目录 asr-models/ 下,可在模型面板中删除,删除后语音输入功能回到「待下载」状态。

识别不准怎么办?

确认环境噪音和麦克风质量;中英文混杂场景优先用 SenseVoice。识别结果会先进输入框而不是直接发送,可以手动修正后再提交。

为什么网页端不是离线的?

网页端依赖浏览器内置的 Web Speech API,它本身由浏览器厂商提供(多数实现在云端识别)。需要离线语音输入请使用桌面端。

相关阅读

基于 AGPL-3.0 协议发布。