Zachary7456/dsh-voice-mic

Zachary7456★ 3JavaScript最后同步: 2026-08-15

在 GitHub 打开

DeepSeek Harness (dsh) 语音输入插件:麦克风按钮/快捷键录音,实时转写回填输入框。三种识别引擎:浏览器 Web Speech、本地 SenseVoice/Paraformer 离线后端(一键部署)、OpenAI 兼容云端 ASR API。

README 摘要

dsh-voice-mic English DeepSeek Harness Web GUI 语音输入插件。录音后实时转写并写入输入框,不自动发送。 安装 要求:dsh =0.1.0-rc.6 、Node.js =18 。浏览器识别需 Chrome/Edge;本地后端另需 Python 3.9+ 。 安装后重启 dsh web 。插件带 bundle patch,会自动挂进 profile,无需手动改 cordis.patch.yml 。 验证: 使用 - 输入框左侧麦克风按钮:点按切换录音,默认快捷键 Alt+V (设置页可改) - 录音期间识别结果实时写入输入框草稿;停止后提交,不自动发送 - 快捷键仅在页面获得焦点时生效(浏览器限制) - 实时写入采用追尾替换:只更新上次追加的尾缀,不覆盖手动输入;无结果或出错时自动回滚 识别引擎 设置 → 语音输入 → 识别引擎,三选一。 浏览器内置(默认) 零配置,走 Web Speech API。中文质量与延迟取决于浏览器与网络。说话停顿导致浏览器自行断开识别会话时,插件自动重启识别器继续监听,直到手动停止。 本地离线后端 设置页一键部署:检测 Python → pip 安装依赖 → 下载模型(断点续传,可取消)→ 启动 asr server.py → 轮询就绪。已下载的模型会缓存,切换模型免重复下载。 模型: 模型 适用 大小 SenseVoiceSmall int8 中/英/日/韩/粤,日常使用 158MB Paraformer 仅普通话,准确率与标点最佳 223MB - 模型目录: /.dsh/voice/models/ (可用 DSH VOICE MIC MODEL DIR 覆盖);下载缓存: /.dsh/voice/cache - 服务端口默认 7860 ,只绑定 127.0.0.1 - 后端进程由 dsh 托管:dsh 重启后需重新点部署(或配置 autoStart: true 自动拉起) - 转写期间音频不出本机 云端 API OpenAI 兼容的 POST /v1/audio/transcriptions (multipart file + model ,返回 {text} )。需配置 base URL、API key、模型名;内置 OpenAI / Groq / 硅基流动预设。密钥存于浏览器 localStorage,由浏览器直连服务商,不经过 dsh。 设置页「测试 API 连接」发送静音样本验证配置: 401/403 为密钥错误, 404 通常表示填了完整端点而不是 base URL。 离线验证完整链路可用仓库内的 mock 服务: 实时上屏时录音期间约每秒调用一次 API,会产生相应费用。 工作原理 两半结构: 录音与转写: - 浏览器引擎:Web Speech 的 interim 结果直…

在 GitHub 查看完整 README →
内容/媒体asrdeepseek-harnessdsh-pluginfunasrmicrophonesherpa-onnxspeech-to-textvoice-input

分类