Elohia/dsh-plugin-image-input
Elohia★ 0JavaScriptLast synced: 2026-08-15
DSH 图片转文字输入插件:粘贴/拖拽图片自动转为结构化文字描述发送,给纯文本 LLM 提供图片输入接管(OpenAI 兼容视觉 API)
README excerpt
dsh-plugin-image-input 给 没有视觉能力 的纯文本 LLM(DeepSeek、GPT-4 base 等)提供 图片输入接管 : - 在对话输入框里照常 粘贴 / 拖拽图片 (出现缩略预览) - 直接按 Enter 或点发送 ——插件会自动把图片转成文字描述,与你的文字一起发出 - 会话里收到的就是"你的文字 + 图片识别上下文"(画布/元素/百分比坐标,K线图、截图、图表都适用),模型不会再因为图片拒绝消息 当前模型 支持 图片时(如 qwen-vl / gpt-4o),插件完全放行,走原生图片通道。 也可以先点输入框左侧的 🖼️ 图片转文字 按钮,只把描述插入输入框(不发),自己修改后再发送。 安装(每台 PC 一次) 然后 重启 DSH web 。 配置视觉 API(设置页填写,一次搞定) 重启后打开 设置 → 图片转文字 ,填写: 字段 说明 示例 baseUrl OpenAI 兼容接口地址(不含 /chat/completions ) https://dashscope.aliyuncs.com/compatible-mode/v1 model 视觉模型名 qwen-vl-max / gpt-4o / glm-4v apiKey 你的 API Key( 留空 = 保持不变 ) sk-... maxTokens 最大输出 token 2048 保存即生效(无需重启)。配置存于 /.config/mm-vision/config.json 。 不填设置页也可以:插件会回退读取同路径配置文件或环境变量 MM VISION API KEY / DASHSCOPE API KEY / QWEN API KEY / OPENAI API KEY / GEMINI API KEY 。 使用 1. 粘贴 / 拖拽一张图片到输入框(出现缩略预览) 2. 直接按 Enter 或点发送 (或先点 🖼️ 按钮只转文字) 3. 等约 1 分钟(思考型视觉模型对复杂图较慢),自动转为文字描述并发送 4. 模型就能"看"到图了 转换期间输入框显示"正在把图片转为文字后发送…";失败会提示并保留图片,不会丢内容。 多张图片逐张转换、一起发送。 原理 - 发送接管:Enter / 发送按钮(捕获阶段)→ 输入框有图片草稿且模型非多模态 → 阻止原生提交 - 页面读取 blob 图片(浏览器内存,模型拿不到)→ base64 → 本地路由 /plugins/mmv/analyze - host 以 danger-full-access 策略运行 固定内容的 node 子进程 ,直连你配置的视觉 API (OpenAI 兼容协议)——不依赖本机沙箱后端(Windows ACL / Linux bubblewrap / macOS sandbox-exec), 任…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405