| 配置 | 说明 |
|---|---|
| 股票 | ~300 只 A 股 |
| 时间 | 2023.06 – 2023.12,分钟级 tick |
| 训练集 | 2023.06.01 – 2023.11.30(~123 交易日) |
| 验证集 | 2023.12.01 – 2023.12.07(5 交易日,用于早停) |
| 测试集 | 2023.12.01 – 2023.12.29(~20 交易日) |
| 目标 | 12 分钟后收益率 |
| 指标 | Meow | Ridge 基线 | 提升 |
|---|---|---|---|
| Test Pearson r | 0.0802 | ~0.02–0.03 | ~3× |
| Val Pearson r (best) | 0.0966 | — | — |
| R² | 0.00433 | < 0 | 优于均值预测 |
金融时序预测中 Pearson r 天然很低(随机噪声主导)。学术界共识:分钟级 r > 5% 即具有统计显著性。
衡量各类特征对预测的边际贡献(8 epochs):
| 移除的特征组 | 特征数 | Test r | Δ vs Baseline |
|---|---|---|---|
| 完整模型 | 94 | 0.0763 | — |
| 核心订单簿微观结构 | -17 | 0.0683 | -0.0081 |
| 波动率 | -9 | 0.0340 | -0.0190 |
结论:订单簿微观结构和波动率是两大核心信号源,验证了基于市场微观结构理论的特征设计。
运行:python ablation.py --epochs 8
用不同比例的训练数据评估模型的数据需求(8 epochs):
| 数据量 | 训练天数 | Test r |
|---|---|---|
| 25% | ~30 | 0.0628 |
| 50% | ~61 | 0.0320 |
| 75% | ~92 | 0.0695 |
| 100% | ~123 | 0.0441 |
关键发现:75% 数据(6–10 月)泛化最佳——训练分布与测试分布(12 月)最接近时,效果优于用全部数据。数据的时间分布比绝对数量更重要。
运行:python data_efficiency.py --epochs 8
python sweep.py # 默认多组搜索
python sweep.py --single --epochs 12 --lr 1e-4 --name test