shaoqiuyuavailable/text-llm-vision
shaoqiuyuavailable★ 2PythonLast synced: 2026-08-17
Scene-aware vision routing layer for DeepSeek Harness (dsh): decides which engine/backend an image should go to (chat/UI/table/code) before other vision plugins route it. Switch-gated, front-loaded, never touches other plugins' tools. 场景级识图路由层。
README excerpt
text-llm-vision:给纯文本模型装上「本地视觉眼睛」 让没有视觉的纯文本 LLM(DeepSeek、Qwen、Kimi、GLM 等)在任意主流 AI 编码智能体(Claude Code / Cline / OpenCode / Codex)里真正"看得见" ——图片进去,文字描述出来,模型基于描述正常推理。全程本地、零 API 费用、数据不出机器。 一句话定位 :不是一个简单的"视觉代理",而是一个 本地视觉增强引擎 ——专为"纯文本模型 + 任意 AI 编码智能体"设计,用 MCP 主路径 + 代理兜底 + 软规则三层互补架构 + Scan/Zoom/Guess 三次判定流水线 , 三协议通用 (Anthropic / OpenAI Chat / OpenAI Responses), Docker 可部署 ,配 VS Code 可视化控制面板 ,把 8B 小模型的视觉潜力榨到极致。 参考了 glm-vision 的「MCP + 代理 + 软规则」三层互补架构,视觉后端落在 本地视觉模型 (默认 Qwen2.5-VL,可换任意 Ollama 视觉模型)。 English / Keywords : MCP vision tools (primary path) + a paste-image reverse-proxy fallback for text-only LLMs (DeepSeek, Qwen, Kimi, GLM) used by any AI coding agent (Claude Code / Cline / OpenCode / Codex / Continue / Copilot / Cursor). Three-layer design: MCP server ( describe image ), reverse proxy (paste-image fallback), CLAUDE.md soft rules . Triple protocol : Anthropic Messages, OpenAI Chat Completions, OpenAI Responses — decoupled from any vendor. Vision backend: local vision model (default Qwen2.5-VL, swappable via config) with Scan/Zoom/Guess three-pass pipeline. Zero API cost , fully local/offline , Docker deployable, VS Code control panel. Upstream decoupled: CC Switch auto-follow (Anthro…
View full README on GitHub →Category
Prompt as Code | GPT-Image2 工业级提示词引擎与模板库,470+ 个案例逆向工程,20+ 套工业级模板,并提炼出Skills,持续更新中
★ 10,851
liustack/modlensThe first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,700
Alisa0808/vox-directorTurn one topic into a finished Vox-style paper-collage explainer/ad video — automated end to end on Atlas Cloud + ffmpeg. An agent skill.
★ 1,335