satan9394/dsh-llm-finetuning
satan9394★ 0JavaScript最后同步: 2026-08-19
DSH skill: LLM 微调路由与配方, SFT/DPO/GRPO 选型(受 wshobson/agents 38k★ 启发)
README 摘要
dsh-llm-finetuning DSH(DeepSeek Harness)技能插件: LLM 微调路由与配方 。 先判断是否该微调(RAG/提示词出口)、方法路由(SFT/DPO/ORPO/KTO/GRPO+RLVR/CPT)、LoRA/QLoRA 配方、评估先行(eval harness)、量化导出。受 wshobson/agents(38k★ MIT)启发的中文原创精简版。 安装 触发方式 描述中包含"微调 / fine-tune / LoRA / QLoRA / DPO / GRPO / RLVR / 偏好优化 / 强化训练 / eval harness"等关键词时自动触发。 能力 - 出口优先路由(易变事实→RAG、未定行为→提示词、稳定知识→CPT+SFT) - 方法选型(SFT/DPO/KTO/GRPO 按数据形态) - LoRA/QLoRA 配方要点与评估先行纪律 - 量化导出(FP8/NVFP4/AWQ/GGUF)与质量验证 许可 MIT
在 GitHub 查看完整 README →分类
🌊 The original agent meta-harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and build conversational AI systems. Features adaptive memory, self-learning intelligence, RAG integration, and native Claude Code / Codex / Hermes and many more Integrated
★ 68,716
volcengine/OpenVikingSelf-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills.
★ 31,761
titanwings/colleague-skill将冰冷的离别化为温暖的 Skill,欢迎加入数字生命1.0!Transforming cold farewells into warm skills? It's giving rebirth era. Welcome to Digital Life 1.0. 🫶
★ 23,757