ShiXiangYu2/dsh-siliconflow-vision
ShiXiangYu2★ 0JavaScriptLast synced: 2026-08-16
DSH 插件:通过硅基流动(SiliconFlow)视觉大模型识别/分析图片 —— dsh-plugin
README excerpt
dsh-siliconflow-vision DSH(DeepSeek Harness)插件:通过 硅基流动(SiliconFlow) 的视觉大模型识别/分析图片。 当前主模型通常只支持文本输入,无法直接"看"图。本插件注册一个 analyze image 模型工具,把图片交给硅基流动的视觉模型(默认 Qwen/Qwen3-VL-32B-Instruct )识别, 再把结果返回给对话模型——从而让 DSH 会话获得完整的图片识别能力。 功能 - ✅ 识别 服务器本地图片文件 (传路径) - ✅ 识别 http(s) 图片 URL - ✅ 识别 base64 data URL - ✅ 自定义识别指令(prompt),如"识别图中所有文字"、"图里有什么动物" - ✅ 可切换模型(Qwen3-VL 系列、GLM-4.5V、PaddleOCR-VL 等) - 🖼️ 可选:交互式"粘贴识别"面板(动态插件形态,见 dynamic/) 安装 方式一:作为 bundle 安装(推荐,持久生效) 把本目录(或 git clone 后的目录)通过 dsh plugin 安装到某个 profile: 安装后 dsh --profile demo 启动即加载 analyze image 工具。 方式二:作为动态插件加载(会话级) 把 dynamic/host.js 与 dynamic/client.js 的内容通过会话的 cordis 插件工具( cordis define + cordis run )加载, 可获得输入框上方的"粘贴识别"面板(浏览器端粘贴/选图 → 识别 → 结果自动发送到主会话)。 注意动态插件是会话级的,进程重启后需要重新激活。 配置 API Key 优先使用环境变量: 或者写入密钥文件(任选其一,文件内容为纯文本 Key): Key 在 硅基流动控制台 获取。 使用 在对话中让模型识别图片即可,例如: 模型会调用 analyze image 工具,参数: 参数 必填 说明 image ✅ 服务器本地路径 / http(s) URL / data URL prompt — 对图片的问题或指令,缺省为通用中文描述 model — 硅基流动模型 ID,默认 Qwen/Qwen3-VL-32B-Instruct maxTokens — 输出 token 上限,默认 1024 可选模型 模型 ID 特点 Qwen/Qwen3-VL-32B-Instruct 默认,识别能力强 Qwen/Qwen3-VL-8B-Instruct 更快、更省 Qwen/Qwen3-VL-30B-A3B-Instruct 性价比 zai-org/GLM-4.5V 通用视觉 PaddlePaddle/PaddleOCR-VL-1.5 OCR 文字识别专用 技术说明 - 运行环境:Nod…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,208
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 933
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 488