WizisCool/dsh-ears

WizisCool★ 7TypeScript最后同步: 2026-08-21

在 GitHub 打开

Voice input plugin for DeepSeek Harness (dsh): Supports voice input plugins with polishing and multiple backends.

README 摘要

dsh-ears 给纯文本 DeepSeek 一对耳朵。 DeepSeek Harness 的开源语音输入插件 简体中文 · English https://github.com/user-attachments/assets/1363768e-a393-44bd-a008-1ce2055cac41 识别后端支持浏览器原生 Web Speech、本机 Whisper、Groq、阿里云百炼,以及任意 OpenAI 兼容转写接口。润色可以选择 dsh 里已经接好的任何模型,提示词可以自定义。默认快捷键 Ctrl+Shift+Space 。 安装 前置依赖:DeepSeek Harness( 0.1.0-rc.6 至 0.1.1-rc.2 ),Node.js ^22.19.0 =24.0.0 。 从 npm 安装: 如果还没安装 dsh CLI: 从源码安装: 安装完成后刷新 Web UI,输入框右侧会出现麦克风图标。 卸载 如果还没安装 dsh CLI: 从 npm 或源码安装都用这条命令。卸载后刷新 Web UI,麦克风图标会消失。源码安装时本地仓库不会被删掉,需要的话自行删除。 识别后端 后端 工作方式 需要什么 免费额度 Web Speech 浏览器实时识别,边说边出字 Chromium 内核浏览器。音频可能经由浏览器厂商处理 — 本地 Whisper 停止录音后由 Host 调用本机 whisper CLI 转写 预装 openai-whisper,在插件设置页下载模型(权重不随插件打包) — Groq Host 把录音发给 Groq Whisper API Groq API key Always Free,Rate Limits 阿里云百炼 DashScope 同步转写(Flash 系列) HTTPS 源站、API key、模型名;单次上限 300 秒 新人免费额度 自定义 OpenAI 兼容 POST 到指定的 /audio/transcriptions 端点 端点地址、API key、模型名 — 🤝 贡献新后端 — 欢迎 提交 PR 接入更多转写服务 — 上表额度摘自提供商文档,README 更新可能不及时,请以提供商最新说明为准。 Whisper medium 及以上的模型纯靠 CPU 很难在 120 秒内跑完,建议配合 GPU 或更快的本地运行时。 润色 润色模型从 dsh → 设置 → 模型 里已接入的列表中选取。插件只保存提供方、模型名和提示词,LLM key 复用 dsh 已有的配置。 默认提示词会去口头禅、修 ASR 错字,也能处理「不是 A 是 B」的自我纠正和「第一…第二…」的口头列举。留空则使用内置默认提示词,内容可在设置页查看。润色失败或取消时保留原始转写。 本地开发 开发时另开终端跑 pnpm dev:watch 。 pnp…

在 GitHub 查看完整 README →
工具/开发asrdeepseek-harnessdshdsh-pluginspeech-to-textvoicewhisper

分类