kaaaaahn/dsh-vision
kaaaaahn★ 1JavaScript最后同步: 2026-08-21
DSH 本地视觉能力插件:macOS Vision OCR + ollama qwen3-vl 语义描述 + 上传图片桥接
README 摘要
@zenk/vision DSH 本地视觉插件:对话框里直接粘贴截图,AI 就能看到并分析,图片不出本机。 特性 - OCR 带像素坐标 (macOS Vision):识别文字并给出位置,UI 定位直接按坐标说 - 语义理解 (ollama + qwen3-vl):看懂画面布局、元素与异常区域 - 零配置 :自动检测环境、按内存选模型(8G→2b / 16 32G→4b / 32G+→8b)、缺 ollama 自动安装 - 渐进可用 :模型后台下载(1.8 5.7GB)期间 OCR 已可用 - 全本地 :免费、离线、图片不出 Mac 安装 重启 DSH 生效。桌面端把 --profile web 换成 --profile desktop 。 插件市场条目(添加来源 https://kaaaaahn.github.io/dsh-vision/catalog/source.json )依赖 npm 发布,目前暂未上线,请使用上方 GitHub 命令安装。 首次使用会自动下载模型(后台进行),期间 OCR 已可用;环境细节见 docs/ollama-setup.md。 使用 - 直接粘贴图片 发送,AI 自动分析并回复 - 或让 AI 调用 vision analyze(file path=..., describe=true) 分析本地文件(describe 开启语义描述) 文档 - 环境准备与模型选型 - 常见问题(22 条 FAQ) 仓库结构 License MIT
在 GitHub 查看完整 README →分类
:rocket: The Ultimate Image Uploader for Efficient Creators. Supports Obsidian, Typora, VS Code etc. and 60+ image hosting services (S3, GitHub, Cloudflare R2, Imgur, Aliyun OSS...). Paste, upload, done.
★ 27,002
liustack/modlensThe first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 3,503
Tiger3807861189/J-Space-Cognition-Suite-V3.6J-Space Cognition Suite V3.6 - AI cognitive-enhancement Skills based on Anthropic's J-space global workspace research. | 哔哩哔哩:Tiger380 (UID 3494375382321675) — https://space.bilibili.com/3494375382321675
★ 3,013