dongsheng123132/dsh-xiapan-media
dongsheng123132★ 1JavaScriptLast synced: 2026-08-14
Native vision, gpt-image-2 and Seedance plugins for DeepSeek Harness via Xiapan Cloud
README excerpt
dsh-xiapan-media 给 DeepSeek Harness 增加三项原生媒体能力: 1. 识图/OCR : xiapan-vision 路由让仍由 DeepSeek 负责思考的会话可以直接粘贴图片;图片先由虾盘云 qwen3.7-flash 转译为文本,再交回原文本模型。另提供 xiapan vision analyze 、 xiapan vision ocr 、 xiapan vision locate 三个文件工具。 2. 作图/改图 : xiapan image generate 调用 gpt-image-2 ,支持 1–4 张、尺寸/质量与参考图,产物保存到工作区 .dsh-media/images/ 。 3. 视频生成 : xiapan video generate 调用 Seedance,支持文生视频、图生视频、5–15 秒、480p/720p/1080p,产物保存到 .dsh-media/videos/ 。 这不是把 API Key 写死在开源代码中的“共享密钥插件”。客户端插件使用 MIT 开源;模型推理、额度、风控和充值由虾盘云服务端提供。用户安装 U-King、登录并充值后,插件复用设备级凭据 UKING DSH API KEY 。也可自行在 DSH 凭据仓库或环境变量中设置该引用。 安装 本地开发安装: GitHub 固定提交安装: 发布后请把 COMMIT SHA 换成 README/Release 中经过 CI 的完整提交。插件包通过 cordis.patch.yml 一次安装三个独立插件行,任何一项都可以单独从 profile 中删除。 自动粘贴识图依赖文本路由 uking-managed 。安装完成后在 DSH 模型选择器里选择 U-King DeepSeek + 虾盘云识图 (路由 ID xiapan-vision )。如果用户只安装了原生 DeepSeek 路由,可把视觉插件的 innerProvider 改成实际文本 provider ID。 凭据顺序 每次调用时动态解析,不缓存、不打印: 1. DSH credentials 服务中的 UKING DSH API KEY ; 2. 同名环境变量; 3. XIAPAN API KEY ; 4. /.uking/device.json 中的设备凭据。 未找到凭据时会提示登录/充值,不会尝试匿名调用。Authorization 只允许发送到 api.u-claw.org.cn (兼容旧域名 api.u-claw.org 并自动改为 .org.cn )。 付费保护 作图和视频工具默认注册 DSH tools/pre-execute 审批闸门。交互式 DSH 会先显示模型、数量/时长和粗略价格;无审批服务的 headless 环境会拒绝,不会静默扣费。只有管理员明确把 …
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,123
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 794
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 298