v587d/dsh-multimodal-skill
v587d★ 1PythonLast synced: 2026-08-14
给纯文本 LLM 一双慧眼。 一个 DeepSeek Harness(DSH)原生 skill + 零依赖 Python CLI, 为 DeepSeek 等纯文本模型补上图像理解与文档解析(OCR、表格、公式、PDF → Markdown), 使用免费额度优先的三方多模态 API,国内网络直连、无需代理。
README excerpt
dsh-multimodal-skill · 慧眼 🌐 中文 · English README 给纯文本 LLM 一双慧眼。 一个 DeepSeek Harness(DSH)原生 skill + 零依赖 Python CLI, 为 DeepSeek 等纯文本模型补上 图像理解 与 文档解析 (OCR、表格、公式、PDF → Markdown), 使用免费额度优先的三方多模态 API,国内网络直连、无需代理。 核心特色 —— 🔄 内容寻址缓存 :相同文件 + 相同问题只调一次 API(sha256 指纹、磁盘落盘、 跨会话共享、TTL/LRU 自动淘汰), 避免重复请求、浪费免费额度 ;再叠加零依赖 (纯 Python 标准库)与自愈 provider 链(模型下线 / 限流 / 坏 key 自动切换),开箱即用。 慧眼 《慧眼》,灵感源自 1993 年的流行歌曲《雾里看花》。 作者在使用 DeepSeek 的过程中,仿佛听到它发出这样的呼唤:“借我借我一双慧眼吧,让我把这纷扰看得清清楚楚……”。 如今有了“慧眼-skill”,我终于可以对 DeepSeek 说:“帮我把这张截图看清楚”—— 它会自动调用 mm cli.py ,把 OCR/解析结果读回上下文,再回答你。 为什么需要这个 skill? DeepSeek(以及许多编码模型)是纯文本的——它们看不见。 当你把截图、PDF 或图表 交给 agent 时,模型无法理解。这个 skill 就是那座缺失的桥: 模型把提取出的 Markdown 当作自己的“视网膜”:忠实 OCR 与版面解析交给专用解析 API (一个 0.9B 的文档 VLM 在忠实解析上胜过前沿通用模型 —— OmniDocBench 基准), 语义理解由文本模型自己完成。 特性亮点 - 零依赖 —— 只有一个 mm cli.py ,纯 Python 标准库( urllib / json / base64 )。 无需 pip install 、无需 requirements.txt 、无需 venv。 - 免费优先 —— 每个默认 provider 都有慷慨的免费额度: PaddleOCR 官方 API(每模型 3000 页/日)、MinerU(免 key)、智谱 GLM-4V-Flash(完全免费), 另有 SiliconFlow 与 DashScope 兜底。 - 国内网络友好 —— 默认 providers 全部国内可达,无需代理 (Gemini / Mistral / HuggingFace 国内不可达 —— 已剔除)。 - 自愈 —— 模型下线、限流(429)、队列满、key 失效全部自动处理: 候选模型轮换、provider 链切换、退避重试、短期失败记忆。 见 references/troubleshooting.md …
View full README on GitHub →Category
A public gallery of animated pets for Codex, Claude Code, DeepSeek Harness, Hermes, OpenCode, Gemini CLI, and more.
★ 3,768
ccch1mneyyy/dsh-TUI解决DSH 官方尚无终端 TUI 痛点的补位之作,献给偏爱cli的各位极客:Claude Code 风格全屏交互终端插件——像素鲸鱼顶栏、实时工作状态行、思考流式展开、双击 Esc 回滚、上下文进度条 + TPS 仪表。npm 一键安装。
★ 769
TencentCloud/tencentmeeting-cli腾讯会议命令行工具(CLI),基于腾讯会议开放平台 OAuth2 授权,支持会议管理、录制管理、参会报告等功能。
★ 213