Nothree-code/voco-input-sh
Nothree-code★ 1JavaScript最后同步: 2026-08-15
DeepSeek Harness (dsh web) 语音输入插件:集成 VocoType 本地离线识别,识别结果自动插入聊天输入框(自动部署/防重复/持续输入)
README 摘要
voco-input-sh DeepSeek Harness(dsh web)持久语音输入插件:在聊天输入框旁提供麦克风按钮,弹出录音面板,把本地语音识别软件 VocoType 的识别结果自动插入输入框。 基于 VocoType(开源离线语音输入,Paraformer 中文识别 + FSMN-VAD + CT-Transformer 标点),本插件负责「检测/启动/自动部署 VocoType → 读取识别日志 → 去重 → 自动插入输入框」的完整闭环。 功能特性 - 🎙 麦克风按钮 :输入框工具行右侧,千问风格图标,hover 高亮、录音中红点呼吸 - 🪟 录音面板 :输入框上方弹出,波形动画 + 状态提示 + 累计计数(已插入 N 条) - 🚀 自动准备引擎 :检测 VocoType 进程 → 未运行自动启动 → 未安装自动下载官方安装包(NSIS 静默安装到 %LOCALAPPDATA%\Programs\VocoType ) - ✂️ 防重复插入 :VocoType 会把文字粘贴到焦点窗口,插件插入前检查草稿是否已包含该文本,避免双份 - 🔁 持续输入 :点一次按钮开始,连续说多句全部自动插入,再点按钮结束 - 🔧 错误重试 :面板出错时提供「重试」按钮 - ⚡ mtime 优化轮询 :日志文件无变化时不重复读取 - 💾 路径动态探测 :日志路径基于 %LOCALAPPDATA% ,exe 探测 5 个常见安装位置,换机器可用 安装 1. 将本包放入 dsh profile 的 packages/ 目录(例如 C:\Users\ \.dsh\profiles\web\packages\voco-input-sh ) 2. 在 profile 根目录安装: 3. 在 cordis.patch.yml 添加挂载行: 4. 重启 dsh web ,麦克风按钮自动出现在聊天输入框工具行。 依赖项:需要 pnpm。VocoType 会自动部署,无需预装(首次会自动下载约 25MB 安装包并静默安装,模型约 1.6GB 由 VocoType 首次启动时下载)。 使用 1. 点击输入框右侧 🎙 按钮 → 弹出录音面板(波形动画 +「按住 AltRight 说话」) 2. 按住 AltRight 说话,松开 3. 识别文字自动插入输入框(若 VocoType 已粘贴到输入框则自动去重) 4. 连续说多句会全部按顺序插入;再点按钮(或面板 ✕)结束 工作原理 - Host ( lib/index.js ):Node ESM, webServer 注册三条 HTTP 路由( /dsh-voco-ensure 、 /dsh-voco-baseline 、 /dsh-voco-poll ), node:fs 直读日志、 child process 调 Power…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405