# 量化 ML/DL 架构地图(dsh-ml · PCPT 知识层) > 定位声明:本文公开**方法与知识**,不公开生产策略。PCPT(内部策略生产团队) > 使用与本文同源的工程语言做更深的工作;dsh-quant 侧提供可手算、可测试的 > 最小框架(线性模型 / walk-forward / 因子评价),让任何 dsh 用户都能从 > 「数据 → 模型 → 样本外验证」走一遍完整流程。 ## 1. 量化 ML 的研究管线架构 一切量化 ML 研究都收敛到同一条管线,每一环都可被上一环的泄漏污染: ``` 数据获取 → 清洗/对齐 → 特征工程 → 标签构造 → 模型训练 → 样本外验证 → 风险/成本 → 执行 ↑ ↓ └──────────── 数据质量与标注(dsh-data 提供工具) ←──┘ ``` - **标签构造**:`features[t] 预测 returns[t+1]`——对齐必须显式,任何「用 t 期的 信息解释 t 期收益」都是未来函数(look-ahead)。 - **验证与训练分离**:随机切分在时序数据上**不合法**(相邻样本自相关,随机 切分会把未来信息泄漏进训练集)。金标准是 walk-forward(见 §3)。 - dsh-quant 对应工具:`quant_data_quality` → `quant_factor_evaluate` → `quant_factor_neutralize` → `quant_linear_model` / `quant_walk_forward` → `quant_metrics` / `quant_risk` → `quant_research_pipeline`。 ## 2. 模型阶梯:从线性到强化学习 复杂度递增 = 拟合能力递增 = 过拟合风险递增 = 可解释性递减。**先证明线性 版本有效,再往上爬**——每一级都要用样本外证据证明「复杂度换来了增量」。 | 阶梯 | 典型用法 | 优势 | 代价 | |---|---|---|---| | **线性(OLS/Ridge)** | 因子合成、收益归因 | 可解释、可手算、参数少 | 只捕捉线性关系 | | **逻辑回归** | 方向预测(涨/跌分类)| 概率输出、稳健 | 仍是线性决策面 | | **树系(GBDT 等)** | 非线性交互、特征选择 | 交互/阈值自动 | 易过拟合、需强正则 | | **深度学习(LSTM/Transformer)** | 序列模式、多资产联合建模 | 表达力强 | 数据饥渴、黑箱、调参重 | | **强化学习** | 直接优化交易策略 | 端到端优化决策 | 非平稳、样本效率低、安全约束难 | - dsh-quant 实现到**线性 + walk-forward**(可手算的诚实基线),并给出 `quant_linear_model` 的 Ridge 正则化——正则化是爬更高阶梯前的必修课。 - 树/DL/RL 属 PCPT 内部生产范畴;本文给出问题形式化(§5),不给出实现。 ## 3. 样本外验证金标准 - **Walk-forward(滚动前推)**:训练窗口只用过去,预测未来一段,窗口滚动 前进。`quant_walk_forward` 实现:输出全样本外预测 + OOS IC/RankIC + 逐窗口 权重(训练集拟合优度 trainR2 只是参考,OOS 才是证据)。 - **禁止随机 K 折**:时序数据 `t` 与 `t+1` 相关,随机切分 → 训练集含未来 → IC 虚高。若必须用 K 折,需要 Purged K-Fold(剔除训练/验证边界附近的样本) + Embargo(验证集后再隔一段)。 - **Deflated Sharpe(去膨胀夏普)**:试了 N 组参数/特征后,最大夏普会被 「多次试验」抬高;显著性需按试验次数校正(Harvey & Liu)。规则化操作: 参数网格搜索后看**收益面是否平滑**——最优参数是孤峰多半是过拟合。 - **样本内外衰减比**:样本内 IC 与 OOS IC 的比值。衰减超过 50% 要警惕; OOS IC 在 ±0.02 以下基本是噪声(单资产日频)。 ## 4. 过拟合诊断清单 1. **参数平面平滑性**:grid search 的热力图应呈连续山丘;孤立的尖峰 = 过拟合 (`quant_backtest_grid` 可用来画参数-收益面)。 2. **特征/样本比**:经验线「每特征 ≥ 30 样本」;特征越多越需要正则化 (Ridge λ、树深度、dropout)。 3. **IC 衰减形状**:好因子 IC 随 horizon 平滑衰减(`icDecay`),尖峰单期 衰减 = 脆弱。 4. **换手成本校验**:IC × 换手 × 单边成本 ≥ 阈值才可交易;高换手因子在 加成本后常常归零(`quant_factor_evaluate` 的 turnover 字段)。 5. **防御性思维**:任何「看起来太好」的结果先怀疑泄漏(未来函数、幸存者 偏差、复权错误),再怀疑过拟合,最后才相信信号。 ## 5. 强化学习问题形式化(知识层) 量化 RL 的标准形式化(dsh-quant 不实现,供研究与讨论对齐语言): - **状态 S**:特征向量 + 当前持仓/组合权重 + 市场环境。 - **动作 A**:目标权重向量(连续)或调仓档位(离散)。 - **奖励 R**:组合收益 − 交易成本 − 风险惩罚(如波动率/回撤的负项)。 奖励必须**净额**(扣成本),否则策略会过度交易。 - **环境**:历史行情回放(backtest 即环境);非平稳性是核心难点—— 市场结构会漂移,训练/测试分布不一致。 - **评估与训练分离**:RL 的训练曲线在金融里几乎无意义;必须用独立的 walk-forward 样本外区间评估,且要跑多次种子取分布而非单次最优。 - **为什么生产 RL 难**:样本效率低(一次交易一天)、探索代价高(真金白银)、 安全约束硬(仓位/回撤上限)。这些正是 PCPT 内部工程要解决的问题—— dsh-quant 提供「把 RL 决策接回回测/风控」的框架接口(`quant_execute_sim`、 `quant_backtest_*` 的输出契约)。 ## 6. 边界重申 - **公开**:方法、框架、demo、知识(本文 + `demos/ml-workflow.ts` + `quant_linear_model` + `quant_walk_forward`)。 - **内部**:生产策略、特征库、模型参数、RL 实现(PCPT)。 - 内外共用同一套域语言,互相学习:内部吸收开源验证方法论,外部共享 「可复现的最小工作流」。