Lbunc/dsh-local-llm-controller

Lbunc★ 0JavaScript最后同步: 2026-08-21

在 GitHub 打开

为DSH接入本地大模型能力:在「设置→插件」页一键启停本地 llama.cpp 大模型(35B/9B,视觉×文本×快速/长上下文),卡片内配置、一条命令安装、自动注册,装完即用。 | start/stop a local llama.cpp llama-server right from Settings → Plugins, with Qwen3.6-35B / Qwen3.5-9B (vision × text, fast × long-context) as session models — card config, one-command install, auto-registered.

README 摘要

🚀 dsh-local-llm-controller DSH 插件:设置页一键启停本地 llama.cpp,让本地大模型成为 DSH 会话模型 English 简体中文 ✨ 概览 在 DSH(DeepSeek Harness)的「设置 → 插件」页面一键启停本地 llama.cpp llama-server ,把本地大模型直接接入 DSH 作为会话模型。 支持矩阵(双模型 × 双模式 × 双预设) 模型 文本 / 快速 文本 / 长上下文 视觉 / 快速 视觉 / 长上下文 Qwen3.6-35B-A3B (IQ4 NL) 32K 128K 32K + mmproj 96K + mmproj Qwen3.5-9B (Q4 K M) 32K 64K 32K + mmproj 64K + mmproj 三步上手 :卡片里填好 llama.cpp 目录与端口 → 选模型/模式/预设 → 点「启动」。会话顶部选择本地模型即可对话;「停止」释放端口。状态(运行中 / 错误 / PID / 日志)实时显示在卡片上。 🌐 卡片界面文案跟随 DSH Web 的语言设置(简体中文 / English),无需额外配置。 ① 设置 → 插件(配置卡片) ② 设置 → 模型(添加到模型列表后出现) : : : : ③ 会话模型选择器 : : 🧩 本插件只负责 DSH ↔ llama.cpp 的连接与控制 :不包含 llama-server 本体,也不负责下载模型——分别来自上游 llama.cpp 与社区量化发布(如 Hugging Face)。 🖥️ 环境需求 项 要求 DSH ≥ 0.1.0-rc.7,含 web profile llama.cpp llama-server 可执行文件(作者验证 0.1.2-dev build 10488,CUDA 13.3 构建;CPU 构建也能跑 9B,配置 ngl: 0 ) 模型文件 两个 GGUF + 两个 mmproj(路径在卡片里配) 硬件 作者环境 RTX 4070 SUPER 12GB + 32GB 内存(i5-13600KF);128K 长上下文需充足内存 系统 Windows 为主(Linux/macOS 把 serverExe 改为 llama-server ) 推荐模型文件 (体积参考): 文件 用途 体积 Qwen3.6-35B-A3B (IQ4 NL GGUF) 35B 主模型 20GB mmproj (Qwen3.6-35B-A3B) 35B 视觉投影 1.5GB Qwen3.5-9B (Q4 K M GGUF) 9B 主模型 6GB mmproj (Qwen3.5-9B) 9B 视觉投影 700MB 📦 安装 方式一:一条命令(推荐) 装完 重启 DSH Web 即可——本包声明了 dsh.bundle…

在 GitHub 查看完整 README →
内容/媒体cordisdsh-pluginllama-cppllama-serverlocal-llmqwenvision

分类