Harzva/dsh-voice

Harzva★ 0TypeScript最后同步: 2026-08-21

在 GitHub 打开

README 摘要

dsh-voice 回合制语音通道 for DeepSeek Harness( dsh )——为「面向面试者的 preset」而生的语音插件。 Agent 通过三个工具获得语音能力,浏览器端自动配合录音/播放,形成完整的一问一答闭环: 工具 方向 作用 voice speak Agent → 人 把提问/反馈合成语音,浏览器自动播放 voice listen 人 → Agent 弹出录音面板,候选人作答后自动转写回传 voice status — 引擎健康检查(TTS/ASR 可用性、队列、录音状态) 三引擎 provider 抽象 TTS 与 ASR 各自独立选择引擎, auto 模式按 qwen → mimo → local 顺序探测,取第一个可用者: 引擎 TTS ASR 依赖 qwen (首发) qwen3-tts-flash (DashScope 原生 multimodal-generation) qwen3-asr-flash (OpenAI 兼容 /audio/transcriptions ) 环境变量 DASHSCOPE API KEY mimo MiMo-V2.5-TTS ( POST /audio/speech ) MiMo-V2.5-ASR ( POST /audio/transcriptions ) 环境变量 MIMO API KEY ;baseUrl/model 可配(本地 MiMo 网关同理) local sherpa-onnx / piper 二进制 / macOS say sherpa-onnx(paraformer/zipformerCtc 等离线模型)/ whisper.cpp 二进制 本地模型与二进制,零 API 依赖 本地 ASR(sherpa-onnx)已验证闭环 :macOS say 合成中文 → 16 kHz WAV → sherpa-onnx-paraformer-zh-small-2024-03-09 (int8,约 82 MB,hf-mirror 可下载) 转写,552 ms、逐字命中。插件将 sherpa-onnx-node 声明为 optionalDependency, 本地引擎生效只需:模型目录就位 + 配置 asr.local.{kind, modelType, modelDir, model} 。 音频落盘在 /.dsh/voice (可配),由本机 loopback 路由(支持 Range)服务给浏览器;浏览器端以 16 kHz 单声道 WAV 录音(对所有 ASR 后端通用)。云引擎只收到需要转写的音频本身。 安装 安装后重启对应 profile 生效。插件行的默认配置是中性值;在你的 profile 的 cordis.patch.yml 里按行 id dsh-voice 覆盖(不要重复 in…

在 GitHub 查看完整 README →
工具/开发dsh-pluginagent

分类