haiziyao/dsh-vision-mix

haiziyao★ 2TypeScript最后同步: 2026-08-16

在 GitHub 打开

Vision routing and image generation for DeepSeek Harness through a fixed Mix model.

README 摘要

Vision Mix Vision Mix 是 DeepSeek Harness 的视觉增强插件。它把文本模型、视觉模型和可选的图片生成 API 组合成一个 Mix 模型,让原本不支持图片的 Agent 能识别上传图片、理解网页截图、持续追问图片内容,并生成或编辑图片。 模型的 Base URL、协议和 API Key 仍由 DSH 的“设置 → 模型”统一管理。Vision Mix 只引用已经配置好的 Provider,不复制凭据。 三分钟上手 1. 安装 在 DeepSeek Harness 仓库目录执行: 启动 Web: 安装后的正常启动不需要 --patch 。 2. 配置准备使用的模型 打开“设置 → 模型”,配置至少两个模型: 用途 要求 示例 基础模型 能处理文本、推理和工具调用 deepseek-chat 、 deepseek-v4-pro 识图模型 中转站实际支持 OpenAI/Anthropic 图片消息 gpt-5.6-sol 、其他视觉模型 识图和基础模型可以来自同一个 Provider,也可以分别使用不同中转站。 如果还要生成或编辑图片,再配置一个支持 OpenAI-compatible /images/generations 和 /images/edits 的 Provider。它可以使用与识图模型完全不同的 Base URL 和 API Key。 3. 一键接入中转站识图模型 打开“设置 → Vision Mix”,在“识图模型接入”中: 1. 从“待接入模型”选择刚才配置的视觉模型。 2. 点击“一键测试并配置”。 3. Vision Mix 会临时授予该模型 image 能力,发送一张红色测试图。 4. 模型正确识别红色后,Vision Mix 才会保存能力声明并把它设为图片模型;失败会自动回滚。 测试会产生一次很小的模型调用,但不会出现在聊天会话中。 4. 选择基础模型和可选能力 继续在“设置 → Vision Mix”完成: 1. 选择基础模型。 2. 确认图片模型是刚才测试通过的模型。 3. 根据需要选择意图识别模型,用于判断“再详细一点”等模糊的跨轮图片追问。 4. 根据需要开启“自动识别 Agent 工具返回的截图或图片”。 5. 点击“保存路由”。 5. 开始使用 新建对话,在模型选择器中选择 Mix ,然后尝试: Mix 是 Vision Mix 注册的固定模型入口,不是一个需要单独填写 API Key 的模型服务。 中转站识图模型接入说明 很多中转站的 /models 只返回模型 id,不会声明模型能否接受图片。DSH 会安全地把这类自定义模型视为纯文本模型;如果直接发送图片,请求会在本地被拒绝,并不会到达中转站。 Vision Mix 提供三种接入方式: 操作 是否调用 API 结果 : 仅测试图片能力 是…

在 GitHub 查看完整 README →
内容/媒体deepseek-harnessdsh-plugingpt-image-2image-generationmultimodalvisionagent

分类