1. 项目定位
本项目选择“机器学习与 A 股横截面收益预测”,以大量公司特征预测未来收益为主线,并保留市场状态自适应 FT-Transformer 作为核心创新。
项目题目为:市场状态自适应 FT-Transformer:A 股横截面收益预测研究。
项目包含两条同步推进、接口解耦的工作流:
- 模型研究负责数据、特征、训练和预测文件;
- Wangwen 负责 IC、Rank IC、分组收益、指标汇总和图表;
- 两边通过
datetime / code / value标准预测文件连接。
2. 研究问题与假设
本项目集中回答两个问题:
- FT-Transformer 学习因子间非线性交互后,能否提高 A 股未来收益的样本外排序能力?
- 根据市场状态动态调整因子表示,是否比直接拼接市场变量更有效?
研究假设:
- H1: LightGBM 与 FT-Transformer 能从公司特征中识别 Elastic Net 难以捕捉的非线性关系与变量交互;
- H2: 市场状态自适应 FT-Transformer 优于原始 FT-Transformer;
- H3: 自适应机制的增量主要出现在市场状态切换或高波动阶段。
如果实验不支持假设,也应如实报告。目标是完成可信比较,不是预设 Transformer 一定胜出。
3. 数据与时间范围
股票池固定为历史时点沪深北全 A,保留退市股票历史,不按当前上市状态筛选。
时间切分:
| 数据集 | 时间范围 | 用途 |
|---|---|---|
| 训练集 | 数据起始日至 2021 年末 | 拟合模型 |
| 验证集 | 2022 - 2023 年 | 选择超参数和停止轮次 |
| 测试集 | 2024 - 2025 年 | 最终样本外评价 |
任何模型和超参数选择不得使用测试集结果。
输入特征
所有模型共用 50 个数值公司特征:30 个 Qlib Alpha158-Core,7 个规模估值、5 个盈利质量、4 个成长、2 个财务风险和 2 个流动性特征。财务只在公告后下一交易日起生效;行业仅用于填充、审计和解释。
市场状态另表保存,不计入 50 个公司特征:全 A 等权 1/5/20 日收益、20 日波动率、总成交额、20 日成交额相对值和上涨家数占比。
预测标签
标签采用下一交易日收盘进入、持有五个完整交易日后的复权收益:
训练标签可以进行横截面去极值或标准化,但回测必须保留原始收益。
4. 数据规范
- 训练、验证和测试必须按时间顺序划分;
- 滚动特征不得包含未来数据;
- 标准化参数只能来自当日横截面或训练样本;
- 明确处理停牌、涨跌停、ST/PT/退市整理、新股和缺失数据;
- 使用历史股票池,避免幸存者偏差;
- 回测信号与实际交易之间至少错开一个可交易时点;
- 保存实验配置、随机种子和结果,不只挑最好结果。
5. 模型设计
基准模型
完成 Elastic Net 与 LightGBM,分别检验稀疏线性关系和非线性变量交互。
原始 FT-Transformer
FT-Transformer 将每个结构化特征映射为独立 token:
模型在因子轴上使用自注意力学习因子交互,并使用 [CLS] token 的最终表示预测股票收益。
个股因子向量
-> Feature Tokenizer
-> [CLS] + 因子 Tokens
-> Transformer Encoder
-> 收益预测
只复现与数值特征相关的核心模块,不复现原论文全部公开数据集和超参数搜索。
市场状态自适应 FT-Transformer
项目唯一的结构创新是让市场状态动态调节 FT-Transformer 的最终 CLS 表示:
实际 B4 在 Encoder 输出的 CLS 经过 head LayerNorm 后执行一次 8 维条件仿射调制,不修改 Encoder 各层内部 LayerNorm。为判断提升是否只是来自新增市场信息,必须加入“FT-Transformer + 市场变量直接拼接”的 B3 对照模型。
第一版统一使用 Huber Loss。排序损失、换手率损失和端到端组合优化本期不做。
6. 必做实验
| 编号 | 模型 | 实验目的 |
|---|---|---|
| B0 | Elastic Net | 检验稀疏线性关系 |
| B1 | LightGBM | 检验非线性和变量交互 |
| B2 | 原始 FT-Transformer | 完成论文核心模块复现 |
| B3 | FT + 市场变量直接拼接 | 判断增加市场信息本身是否有效 |
| B4 | 市场状态自适应 FT | 检验条件化机制的增量价值 |
所有模型必须使用相同数据切分、特征处理和测试区间,不进行大规模超参数搜索。
7. 评价指标
预测指标:每日 IC、每日 Rank IC、ICIR 和指标时间序列稳定性。
投资指标:样本外 R2、五分组或十分组收益、Top 组累计收益、多空收益、换手率和统一交易成本后收益。
必须展示:五模型统一对比表、分组单调性、累计收益、不同市场状态下的 Rank IC,以及直接拼接和自适应机制的消融比较。
8. Wangwen 接入
P0.1 接口对账固定 Wangwen main commit 2e2c200。2025 年 1,122,222 行显式预测、五日收益和 benchmark 注入已与独立 IC/Rank IC 计算对账通过。
工具开发完成不等于本项目回测完成。P1 权威实验 20260723T014153 已完成 B2/B3/B4 各 2,238,748 行 2024-2025 样本外预测、统一 10bp 成本评估、Wangwen 对账和市场状态消融。最稳健的结果是复杂度与收益不单调:Elastic Net 在 R2 和 Top 成本后均值上保持领先;B3 的 Rank IC 仅在单 seed 下小幅描述性领先,B4 未优于公平重跑 B2/B3。每轮正式实验继续记录 Wangwen commit SHA、模型 commit、数据版本、配置和随机种子。
模型预测输出:
| 字段 | 含义 |
|---|---|
datetime | 模型形成信号的交易日 t |
code | 股票代码 |
value | 预测分数或预测收益 |
Wangwen 默认 close 快捷回测与本项目标签不一致。正式评估需单独计算 t+1 收盘至 t+6 收盘收益并对齐到信号日 t,再通过 BacktestEngine 直接注入预测、收益与 benchmark。
Wangwen 后续跟踪 issue #28(换手率/交易成本)、#29(聚源复权 OHLCV/成交额)和 #30(历史交易状态);均不阻塞已完成的 P0.1。
9. 已完成的计划外补充验证
以下工作扩展证据边界,但不替换 P0.2/P1 权威运行,也不回填主表:
- P0.2 setting 诊断与传统模型小网格: 检查 B0/B1 拟合、B1 早停、B2 延长训练和特征重要性;调优结果保留为 post-hoc 补充;
- P1 CUDA 跨硬件复跑
20260723T093456: 在 NVIDIA A40 上按同一数据、seed、预算和完整测试区间复跑 B2/B3/B4,主要结论未因硬件变化反转; - B3/B4 事后调优
20260723T105957-posthoc-b3b4: 完成 10 个验证期候选和两个 winner 的完整测试,但候选网格设计晚于权威测试结果查看; - B0-M/B1-M
20260723T133208-posthoc-b0m-b1m: 增加配对 control;B0-M 无实质增量,B1-M 的 Rank IC 改善伴随 ICIR 下降和验证/测试方向反转; - 证据与评估增强: 保存 preregistration、输入/源码/预测哈希、失败台账和冻结快照,完成独立指标对账与 CPU/CUDA 双端验证。
这些补充实验没有消除单 seed、已查看测试区间、重叠五日收益和简化交易约束带来的证据限制。
10. 分阶段状态与当前优先级
P0.0-P1:权威研究闭环
P0.0 工具、P0.1 数据、P0.2 基线与 P1 创新均已完成。权威运行固定为 20260722T093202 和 20260723T014153,不覆盖旧结果,不依据测试结果继续调参。
P2:展示闭环(进行中)
已完成正式图表、B2-B4 可编辑架构图、专家修订版 13 页论文 build、12 页 Beamer/PPTX、逐页讲稿、26 项 Q&A 和网站页面。研究测试 54 项通过,网站 Astro check/build 为 0 错误、0 警告。
当前仍需:
- 将最新稳定论文、Beamer、PPTX、逐页预览和 SHA256 清单同步到 workspace 稳定路径与
P2成果/; - 由实际讲述者完成至少两次完整计时彩排,并记录实测时长、断点、翻页、问答反馈和复验结果;
- 保持单 seed 差异为描述性证据,不把 B4 的 CLS 信息瓶颈、状态信号强度或训练抽样写成已证实原因。
P2.1:多 seed 稳健性(待启动)
多 seed 是当前最高优先级研究缺口,必须新建独立运行,禁止覆盖 20260723T014153:
- B2、B3、B4 使用同一组至少 5 个预注册 seed、相同数据投影、训练预算、验证选择规则和完整测试键;
- 逐 seed 报告 R2、Rank IC、日度未年化 ICIR、成本后收益和换手,并汇总均值、标准差及三组配对差异;
- 日频差异采用考虑时间相关性的配对区间或稳健标准误,不以单次最佳 seed 下结论;
- 因 2024-2025 测试结果已被查看,本轮标记为 post-hoc;真正确认性结论仍需预注册的新样本外区间;
- 本轮不同时修改 B4 结构、扩大候选网格或加入 cross-attention。
答辩交付与多 seed 补充并行管理:多 seed 不阻塞 2026-07-25 材料交付,但它是升级研究结论的前置条件。
11. 本期边界
本期不做股票轴/时间 Transformer、GNN、MoE、排序损失、端到端组合优化、大规模调参和复杂 SHAP。后续增强应优先新样本外区间、非重叠组合、完整交易约束与状态差异统计推断,不以增加更多结构变体替代稳健性证据。
12. P2 验收标准
- 论文可从干净目录一次编译成功,无缺图、缺表、未解析引用或明显溢出;
- B2/B3/B4 架构图与实际实现一致,图源可编辑;外部素材有来源和许可记录;
- 所有数字和结果图可追溯到正式实验,论文、网站和 Pre 使用同一组指标与谨慎结论;
- 明确区分预测能力、重叠五日收益比较指标与可交易净值;
- 10-12 页 Pre、讲稿和 Q&A 齐全,并完成至少两次真人计时彩排;
- 多 seed 至少包含 5 个共同 seed 的逐 seed 产物、汇总表和配对统计,原单 seed 结果继续保留并列报告。