对着对话框打字慢?FunASR 离线语音输入插件按住说话自动发
对着 AI 长篇描述需求,打字几百字费时费力,云端语音输入又担心录音上云。dsh-voice-funasr 是 DeepSeek Harness 插件广场里的一款语音输入插件(model-inference 分类):按住录音按钮说话,本地语音引擎精准转写,松手自动填进输入框发送,MIT 协议,平台审核通过。
核心功能与特点
- 纯本地转写:FunASR 离线引擎(Paraformer 大模型加 VAD 断流加标点恢复),三个模型均为官方量化权重,断网可用,音频只在内存流转,临时文件用后即删不落盘
- 两段式润色可选:转写完可让大模型先把口头语修成书面表达再发送,润色走你自己配置的模型端点
- 三重回退:识别后端可设自动、仅本地、仅浏览器;本地引擎不可用自动退回浏览器自带识别,按钮指示灯颜色直接标引擎状态
- 实测响应快:作者实测五秒话术端到端约半秒出稿,引擎常驻后单次识别约零点三秒
- 依赖克制:Python 侧只需 funasr-onnx 加模型下载脚本,不拖整份深度学习框架,模型权重约五百多兆一次下载常驻
怎么获取
在 DeepSeek Harness 插件广场检索 dsh-voice-funasr,或到 GitHub 检索同名仓库按 README 三步走:装 Python 依赖、下载模型、把插件加进客户端 profile,重启后在设置里预热加载一次。
上手用法
- 语音描述复杂需求:按住按钮把背景、目标、约束一口气说完,比打字段式描述完整
- 口头语多的场景打开润色开关,发出去的就是整理过的书面句
- 敏感环境把识别后端固定为仅本地,断网也能用
适合谁用
天天跟智能体对话写需求的开发与运维人员,手边不方便打字时尤其受用。本地方案对录音出网的顾虑也小,隐私敏感的用户可以放心把后端锁在本地。装好预热一次之后,长需求口述、短指令直接说,输入方式的改变会反过来让你的描述更完整。
企业存储选型参考|贵州诚鑫致达
做中小企业全能主力存储,群晖机型参考:DS1823xs+ · DS2422+ · DS923+。需要选型建议或上门评估,搜「诚鑫致达」即可找到我们。