ai-yucheng/dsh-audio-copilot

ai-yucheng★ 1TypeScript最后同步: 2026-08-21

在 GitHub 打开

Audio Copilot for DeepSeek Harness — transcribe audio (ASR) , with an in-composer voice-input mic button. 🎤

README 摘要

🎙️ dsh-audio-copilot · 语音工作台 给纯文本模型补上"听"和"说"的能力 —— DeepSeek Harness (DSH) 音频插件。 Audio Copilot: give your text-only agent ears and a voice. 纯文本模型(如 DeepSeek-V4-Flash)天生 听不懂音频、说不出话 。本插件为它补齐这两块能力,并附赠一个 聊天框语音输入按钮 ——对着麦克风说话,转成文字自动填入输入框,说完即发。 📖 目录 - 🎯 这是什么? - ✨ 核心功能 - 🧠 工作原理 - 🚀 快速开始(小白向,3 分钟) - ⚙️ 完整配置参考 - 🧩 语音引擎怎么选? - 🎤 语音输入按钮使用教程 - ❓ 常见问题 FAQ - 📸 示例截图 - 🤝 配套项目 - 📜 更新日志 - 📄 协议 🎯 这是什么? 能力 说明 🎤 语音输入按钮 聊天输入框旁的麦克风按钮:点击 → 说话 → 自动转文字填入输入框。多引擎可选,中文/方言/外语通吃 一个按钮,解决"说话输入"这件事 ——没有其他隐藏功能,所见即所得。 ✨ 核心功能 🎤 语音输入按钮(最常用) - 浏览器端麦克风录音 → 服务端转写 → 文字自动填入输入框 - 录音 UI:红色脉冲光晕 + 秒表计时 + 停止方块 + 转写 spinner - 最长录音 28 秒 (适配智谱 GLM-ASR 的 30 秒上限),到点自动停止 - 转写失败 大声提示 (错误信息可操作),绝不"没动静";注入失败自动把结果复制到剪贴板 🧠 四引擎转写(自由切换,不锁定厂商) 引擎 特点 适用 zhipu 国内直连 ,GLM-ASR-2512:中文普通话 + 四川/粤/闽/吴方言 + 数十种外语,CER 0.07 顶级,价格极低 🇨🇳 国内用户首选 local 本地 faster-whisper :完全免费、无限用、离线、隐私 不花钱 / 离线场景 gemini 海外多模态,音频理解最强,免费档每时段 20 次限流(429 自动重试) 海外网络 / 最强语义 openai 任意 OpenAI 兼容 /audio/transcriptions 端点(Whisper / SenseVoice 等) 已有第三方端点 🛡️ 可靠性设计 - Gemini 免费额度 429 限流 → 自动按提示等待后重试一次 - 智谱拒 webm → 服务端 ffmpeg 自动转 16kHz wav - 缺 key / 缺 ffmpeg / 端点错误 → 可操作的中文错误信息 - 全部注册走 effect,卸载自动注销;Config 有 schema 校验 🧠 工作原理 🚀 快速开始(小白向,3 分钟) 第 0 步:确认前置 - DSH Desktop 已安装(本插件…

在 GitHub 查看完整 README →
Agent/智能体asraudiodeepseek-harnessdshdsh-pluginfaster-whispergeminispeech-to-text

分类