CZX2244/dsh-bilibili
CZX2244★ 1JavaScript最后同步: 2026-08-14
—
README 摘要
dsh-bilibili DeepSeek Harness 工具插件:给 Agent 添加 bilibili extract 工具。发一个 B 站链接,Agent 自动提取视频文字信息(文稿/评论/弹幕)并按需抓取关键帧,完成总结分析。 本插件不打包任何第三方二进制或模型;所调用的开源项目与服务见 THIRD PARTY NOTICES.md。 ✨ 特性 - 文字信息全量提取 :元数据、完整字幕文稿(带时间戳)、热门评论(含楼中楼)、弹幕(高频 + 时间线样本); 无字幕轨的视频默认用必剪 ASR 转写 (B站播放器「实时AI字幕」同款能力,匿名可用,24h 缓存),也可切换到本地引擎—— sherpa-onnx(中文推荐,SenseVoice) 或 whisper.cpp (通用),离线可用、适配不同配置;单个信息源失败不影响整体(各自降级为空并带 note); - 可选帧图视觉描述 :无视觉能力的主模型也能「看到」画面——帧图可交给本地 Ollama / llama.cpp (Qwen3-VL 2B/4B/8B 三档)或任意 OpenAI 兼容视觉接口转成文字描述,报告按需引用配图; - 混合信号自动选帧 :画面场景切换检测(主信号)+ 字幕视觉暗示词(加权)+ 均匀间隔兜底,5 秒去重; - 两段式工作流 :模型先读文稿(秒级、零下载),再带 timestamps 定向抓帧——每帧自动配附近字幕,视频 24h 缓存复用,多轮迭代不重复下载; - 输出模板可替换 :内置简洁总结模板(省时 + 可转发), summaryTemplate 配置可指向任意自定义模板文件; - 下载优先抓帧 :视频先下载到本地再从本地文件抓帧(≤30 分钟 / ≤800MB),失败或超限自动回退远程逐帧; - 健壮 :B 站 412 限流指数退避重试;无字幕自动识别「需登录」并提示配置 SESSDATA;ffmpeg 无管道调用,任何环境可跑。 🚀 安装 前置:Node 18+、 ffmpeg 在 PATH 中、 pnpm 。 安装后工具自动进入 Agent 的工具链:用户在对话里发 B 站链接( bilibili.com/video/BV... 、 b23.tv 短链或裸 BV 号),模型即可调用它分析。 🎨 自定义输出模板 输出格式是插件的 可替换零件 :数据(文稿/帧/弹幕/评论)由工具提供,长什么样由模板决定。 - 内置默认 : templates/summary.md —— 简洁的「省时间」总结(一句话总结 → 带时间戳要点 → 值得看的片段 → 可转发的分享语); - 内置备选 : templates/timeline.md —— 通用时间轴式(主标题 → 开场钩子 → 时间轴分段小标题 + 内嵌时间戳要点 → 配图锚点 → 结尾结论),配图能配就配、配不了不强…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,123
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 794
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 298