Rtyyy233/dsh-factor-mining-plugin
Rtyyy233★ 0Python最后同步: 2026-08-19
A agentic factor mining plugin for DSH, suitable for small llm like qwen.Its core package could also work independently.
README 摘要
dsh-factor-mining-plugin 让 LLM Agent 在引擎强制的研究纪律下自主挖掘截面因子。 本项目是 DeepSeek Harness(DSH)平台的因子挖掘插件, 包含一个 可独立使用的 Python 研究纪律引擎 (评估/审计/防作弊校验)与 DSH 平台的 TS 工具层接入。不依赖 DSH 也能把 Python 引擎当作「带诚信护栏的因子评估库」直接使用。 主要设计 主要的设计来自于作者在使用Agent进行量化研究时遇到的问题,并逐一使用纯代码的方式解决,以限制Agent犯错。 测试中使用qwen3.7 plus,所有设计是以防止小模型出现数据窥探、错误代码、无效搜索等问题进行的设计,模型的自由度仅在搜索信息、设计因子这一层 前视偏差: OOS划分: 数据默认使用60/20/20的比例划分development/selection/test三区,可修改;test区有锁机制,只有用户首肯才会被动用。 未来数据: Agent提交的因子会使用causality.py检验因子是否使用未来数据: 1.抽样多个时间点t(目前为6个,有需要可自己配置),将t之后的数据置换为随机噪声进行检验(这来自于我的经验,即使你物理隔离了数据,Agent也会在写的代码中出现data[t+1]这种data-hacking行为) 2.抽样多个时间点t(注释同上),将t之后的数据置换为NaN,检验输出是否出现NaN Ic IR 计算: 由于时序数据的自相关性,Agent在采样计算Ic IR时会由于重叠的采样窗口过度夸大因子表现, adapters.py 和 evaluate.py 会自动检验采样步长和时间窗口长度,对重叠窗口予以拒绝。 p-hacking: 1.插件初始化时会生成null landscape来锚定当前数据集的特性 2.对产出的因子会做column-perm test,取 z =3为阈值 3.多重检验校正:系统会计数Agent的搜索轮次N,依据搜索轮次提高p的阈值 重复探索 因子库设计 因子库采用双库结构,原始库中使用贪心算法挑选Ic IR最高、且截面相关性低的因子族构成强因子库;原始库中因子按相关性聚类,新因子与旧因子的相关性通过对不同簇的相关性计算实现,以避免因子数量爆炸带来的计算爆炸。 探索轨迹 与通过算子进行穷举不同,项目将因子设计的自由度交给LLM,在每轮搜索中,LLM需要在trail中记录自己的探索方向、结果以及推理,并在下一次探索中排除已搜索过的方向;prompt中会建议LLM在多次设计失败后搜索arxiv中有时效性的论文作为可选项。 触发50轮次探索或挖掘出3个通过注册校验的因子时,自动终止。 收益可实现性 多头端收益: 由于中国A股做空限制的特性,Agent在探索因子时除了Ic IR以外,还会额外计算Top-N多头收益,并在注册因…
在 GitHub 查看完整 README →分类
🌊 The original agent meta-harness. Deploy intelligent multi-player swarms, coordinate autonomous workflows, and build conversational AI systems. Features adaptive memory, self-learning intelligence, RAG integration, and native Claude Code / Codex / Hermes and many more Integrated
★ 68,716
volcengine/OpenVikingSelf-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills.
★ 31,761
titanwings/colleague-skill将冰冷的离别化为温暖的 Skill,欢迎加入数字生命1.0!Transforming cold farewells into warm skills? It's giving rebirth era. Welcome to Digital Life 1.0. 🫶
★ 23,757