sunxin-ai/dsh-design-qa

sunxin-ai★ 1JavaScript最后同步: 2026-08-20

在 GitHub 打开

Design-fidelity QA for DeepSeek Harness: lend any text-only model an eye, then judge whether the implementation matches the mock. Ships the benchmark behind that judgement — four fixtures, 23 injected defects, and every raw model transcript. Retires itself when DeepSeek ships vision.

README 摘要

dsh-design-qa 简体中文 English 让 DeepSeek Harness 里的纯文本模型能看图。 做这个是为了在 DSH 上实现 产品设计 这项能力:从设计稿写出实现、再自己判断实现得像不像、 不像就修 —— 而 DeepSeek 写得了代码却看不见图,判定那一环做不了。本插件通过一个工具把 多模态能力借给它,让它具备执行产品设计功能所需的那只眼睛。 - 任何纯文本模型都能读图。 不只是 DeepSeek —— 你在 DSH 里自己接的那些 OpenAI 兼容端点 同样适用(实测过 OpenRouter 上的 z-ai/glm-5.2 )。 前提是该模型支持 tool calling : 它得能自己调 deepseek vision 。官方多模态上线那天,本插件自动让位、可原样留着。 - 把识图做成一个 tool。 图片不进主模型上下文;它看到一行 [图片 …] 提示,需要时自己调 deepseek vision 。不看就不产生任何成本,问什么由模型自己决定。 - 附 eval 与原始输出。 4 组夹具、23 处注入缺陷、四条通过线 —— 回答的是「借来的这只眼 够不够格当判定闭环里的裁判」,而不是「模型跑没跑通」。 能看见 ≠ 可用于判定 :看得见但不 主动看、会编、不稳、说不清,四种失效各对应一条通过线。真值四组齐全、有像素级注入断言, 跑分脚本目前接通的是其中 landing 一组 ;基准那一节每个数字的逐格模型原文都在 eval/runs/ , 哪几项没有原文,也在那里标明 。 三步装好 环境要求 :一个 已经能正常对话 的 DSH —— 也就是工作区选好了、主模型的 key 配好了, 随便发一句能收到回复。npm 安装或源码运行都可以,Node ^22.19 =24 (与 DSH 一致)。 macOS / Linux / Windows 通用,安装脚本是一份 Node 实现。 刚下载 DSH 还没配过的话先把这一步做完 —— 本插件只负责识图那条链路( BAILIAN API KEY ), 主模型的 key 是 DSH 自己的事。两者分开:主模型不通,粘图也不会有反应。 1. 拿一个百炼 API Key 去 阿里云百炼控制台 开通并创建 API-KEY。 新用户每款模型送 100 万输入 + 100 万输出 Token,有效期 90 天 (官方说明)。 本插件一次识图约 2000 输入 + 400 输出 token, 免费额度够看几百次图 ,日常用基本不花钱。 2. 装插件 也可以直接从 GitHub 装(拿到的是 main 上最新的,未必等于 npm 上那版): dsh plugin --profile web add github:sunxin-ai/dsh-design-qa 3. 补配套并重启 装好了。 在对话框里粘一张图…

在 GitHub 查看完整 README →
内容/媒体benchmarkdeepseek-harnessdesign-qadesign-reviewdshdsh-pluginllm-evalmultimodal

分类