yauntyour/DSH-Multimodal

yauntyour★ 0TypeScript最后同步: 2026-08-15

在 GitHub 打开

DSH 多模态输入插件:为不同类型的文件(图片 / 视频 / 音频 / 文本)配置独立的处理模型链,在文件进入会话模型之前,先用预设模型把它处理成 Prompt Tokens(文本),再交给会话模型。插件在 DSH 设置中新增独立的 Multimodal 页面。

README 摘要

DSH-Multimodal DSH 多模态输入插件:为不同类型的文件(图片 / 视频 / 音频 / 文本)配置 独立的处理模型链 ,在文件进入会话模型之前,先用预设模型把它处理成 Prompt Tokens(文本),再交给会话模型。插件在 DSH 设置中新增独立的 Multimodal 页面。 解决的问题 DeepSeek 等会话模型只接受文本输入(inputModalities 为 text)。DSH 原生行为是:向这类模型附加图片时直接拒绝(Model does not support image input),视频 / 音频 / 普通文件则根本无法附加。本插件在 发送路径 上拦截文件输入:先调用你配置的多模态模型(如视觉模型)把文件转成描述文本,再把文本作为 Prompt Tokens 发给会话模型。 特性 - 设置页 :DSH 设置中新增「Multimodal」菜单页,按通配符为不同文件格式配置预设; - 预设可增删改 : 自带一个合并默认预设 「多媒体(默认)」——内置 DSH 支持的全部非文本输入类型后缀(png/jpg/jpeg/webp/gif、mp4/webm/mov/mkv/avi/flv/wmv/m4v/mpg/mpeg/ts/3gp、mp3/wav/flac/aac/ogg/opus/m4a/wma/mid/midi),可自由编辑后缀通配符; 可创建多个预设 为不同文件类型配置不同模型(按配置顺序首个匹配生效);模型链为空时自动使用当前默认模型(即"匹配其多模态输入模型"); - 文本原生直通 :文本类型没有预设(所有 LLM 都原生支持文本输入),文本文件永远不做 Multimodal 转换; - 模型链回退 :每个预设可配置多个模型,按顺序尝试,第一个成功者胜出(如视觉模型失败自动回退到下一个); 链为空时自动回退到当前默认模型 (内置预设即如此,开箱即可用); - 提示词留空 = 使用类型默认 :预设的处理提示词留空时,按文件实际类型自动使用默认提示词(图片为「请仔细分析这张图片的内容,并将其转化为详细的文字描述…」,视频/音频为元数据说明);custom 预设匹配到图片时同样以 真实图片块 传入处理模型(custom 只决定匹配方式,不改变传入格式); - 模型需声明图片能力 :处理模型的 Provider 适配器按模型声明的 input 模态决定是否接收图片(pi-ai 本地模型未声明会直接拒绝: model does not support image input )。在 DSH 设置 → 模型 中把本地视觉模型(如 Ollama 的 uGemma4)的 input 配置为 [text, image] ; - 图片默认不自动处理 :设置页开关「发送时自动处理图片」 默认关闭 ——输入里的图片完全按原生行为处理(多模态会话…

在 GitHub 查看完整 README →
内容/媒体agentdeepseekdeepseek-harnessdshdsh-plugindsh-plugins

分类