131CDA1/dsh-scrape-webpage

131CDA1★ 5JavaScriptLast synced: 2026-08-14

Open on GitHub

用于DeepSeek Harness的网页读取插件

README excerpt

dsh-scrape-webpage 网页抓取与分析插件 —— DeepSeek Harness 组合插件(Host-only,零依赖)。 用爬虫读取网站内容并做分析:注册模型工具 scrape webpage ,抓取网页正文,提取标题、页面描述、H1–H6 标题结构、链接列表,统计字符数/词数/预计阅读时长与语言倾向,计算高频关键词(中文二元组 + 英文单词,含停用词过滤);可选下载页面内容图片供视觉分析,并提供 scrape.imageAnalyzer 扩展服务供识图插件接入。 ✨ 功能特性 - 网页抓取 :http/https,自动重定向,非 2xx 状态码优雅返回 - 内容提取 :标题、页面描述、正文(截断可调)、H1–H6 标题结构、链接列表(上限 100) - 自动分析 :字符数、词/字数、标题数、链接数、预计阅读时长、语言倾向(中/英/混合)、高频关键词 Top30 - 图片下载 :提取 (相对路径自动归一化,过滤图标/logo 等噪音),下载到会话工作区 .scrape-images\ ,返回本地路径供视觉模型 read image 分析 - 识图插件接口 :发布 scrape.imageAnalyzer 服务,识图插件注册分析器后,图片自动交给分析器并把结果附在工具输出中 - 安全模型 :默认沙箱内抓取;HTTPS 沙箱 TLS 受限时按 pwsh 工具的升级契约,显式 sandbox permissions + 审批一次性授权 📦 安装 安装到本地 profile 1. 把本仓库复制到目标 profile 的 node modules 下: 2. 把 cordis.patch.yml 中的 insert 行合并进该 profile 的 cordis.patch.yml : 3. 重启 DSH(Web/TUI),插件随宿主组合加载。 🚀 使用 对话中直接说:"帮我抓取 https://example.com 并分析"。工具参数: 参数 类型 说明 url string(必填) 要抓取的网页地址(http/https) maxChars number 返回正文最大字符数,默认 30000,范围 1000–100000 images number 同时下载内容图片数(上限 6,默认 0),图片保存到 .scrape-images\ \ ,返回本地路径供 read image 查看 sandbox permissions string 仅 danger-full-access 。HTTPS 沙箱受限报错提示 escalation available 后,重试同一次抓取时携带;审批弹窗由用户决定 justification string 与 sandbox permissions 配套:一句话说明为何需要更宽权限 输出:成功 { url, st…

View full README on GitHub →
Terminal / TUIdeepseekdeepseek-harnessdshdsh-plugindsh-plugins

Category