1. 项目定位

本项目选择“机器学习与 A 股横截面收益预测”,以大量公司特征预测未来收益为主线,并保留市场状态自适应 FT-Transformer 作为核心创新。

项目题目为:市场状态自适应 FT-Transformer:A 股横截面收益预测研究

项目包含两条同步推进、接口解耦的工作流:

  • 模型研究负责数据、特征、训练和预测文件;
  • Wangwen 负责 IC、Rank IC、分组收益、指标汇总和图表;
  • 两边通过 datetime / code / value 标准预测文件连接。

2. 研究问题与假设

本项目集中回答两个问题:

  1. FT-Transformer 学习因子间非线性交互后,能否提高 A 股未来收益的样本外排序能力?
  2. 根据市场状态动态调整因子表示,是否比直接拼接市场变量更有效?

研究假设:

  • H1: LightGBM 与 FT-Transformer 能从公司特征中识别 Elastic Net 难以捕捉的非线性关系与变量交互;
  • H2: 市场状态自适应 FT-Transformer 优于原始 FT-Transformer;
  • H3: 自适应机制的增量主要出现在市场状态切换或高波动阶段。

如果实验不支持假设,也应如实报告。目标是完成可信比较,不是预设 Transformer 一定胜出。

3. 数据与时间范围

股票池固定为历史时点沪深北全 A,保留退市股票历史,不按当前上市状态筛选。

时间切分:

数据集时间范围用途
训练集数据起始日至 2021 年末拟合模型
验证集2022 - 2023 年选择超参数和停止轮次
测试集2024 - 2025 年最终样本外评价

任何模型和超参数选择不得使用测试集结果。

输入特征

所有模型共用 50 个数值公司特征:30 个 Qlib Alpha158-Core,7 个规模估值、5 个盈利质量、4 个成长、2 个财务风险和 2 个流动性特征。财务只在公告后下一交易日起生效;行业仅用于填充、审计和解释。

市场状态另表保存,不计入 50 个公司特征:全 A 等权 1/5/20 日收益、20 日波动率、总成交额、20 日成交额相对值和上涨家数占比。

预测标签

标签采用下一交易日收盘进入、持有五个完整交易日后的复权收益:

yi,t=AdjClosei,t+6AdjClosei,t+11y_{i,t}=\frac{AdjClose_{i,t+6}}{AdjClose_{i,t+1}}-1

训练标签可以进行横截面去极值或标准化,但回测必须保留原始收益。

4. 数据规范

  1. 训练、验证和测试必须按时间顺序划分;
  2. 滚动特征不得包含未来数据;
  3. 标准化参数只能来自当日横截面或训练样本;
  4. 明确处理停牌、涨跌停、ST/PT/退市整理、新股和缺失数据;
  5. 使用历史股票池,避免幸存者偏差;
  6. 回测信号与实际交易之间至少错开一个可交易时点;
  7. 保存实验配置、随机种子和结果,不只挑最好结果。

5. 模型设计

基准模型

完成 Elastic Net 与 LightGBM,分别检验稀疏线性关系和非线性变量交互。

原始 FT-Transformer

FT-Transformer 将每个结构化特征映射为独立 token:

Ti,j=bj+xi,jWjT_{i,j}=b_j+x_{i,j}W_j

模型在因子轴上使用自注意力学习因子交互,并使用 [CLS] token 的最终表示预测股票收益。

个股因子向量
  -> Feature Tokenizer
  -> [CLS] + 因子 Tokens
  -> Transformer Encoder
  -> 收益预测

只复现与数值特征相关的核心模块,不复现原论文全部公开数据集和超参数搜索。

市场状态自适应 FT-Transformer

项目唯一的结构创新是让市场状态动态调节 FT-Transformer 的最终 CLS 表示:

γt,βt=MLP(mt)\gamma_t,\beta_t=\mathrm{MLP}(m_t) h~i,t=(1+Δγt)hi,t+βt\tilde h_{i,t}=(1+\Delta\gamma_t)\odot h_{i,t}+\beta_t

实际 B4 在 Encoder 输出的 CLS 经过 head LayerNorm 后执行一次 8 维条件仿射调制,不修改 Encoder 各层内部 LayerNorm。为判断提升是否只是来自新增市场信息,必须加入“FT-Transformer + 市场变量直接拼接”的 B3 对照模型。

第一版统一使用 Huber Loss。排序损失、换手率损失和端到端组合优化本期不做。

6. 必做实验

编号模型实验目的
B0Elastic Net检验稀疏线性关系
B1LightGBM检验非线性和变量交互
B2原始 FT-Transformer完成论文核心模块复现
B3FT + 市场变量直接拼接判断增加市场信息本身是否有效
B4市场状态自适应 FT检验条件化机制的增量价值

所有模型必须使用相同数据切分、特征处理和测试区间,不进行大规模超参数搜索。

7. 评价指标

预测指标:每日 IC、每日 Rank IC、ICIR 和指标时间序列稳定性。

投资指标:样本外 R2、五分组或十分组收益、Top 组累计收益、多空收益、换手率和统一交易成本后收益。

必须展示:五模型统一对比表、分组单调性、累计收益、不同市场状态下的 Rank IC,以及直接拼接和自适应机制的消融比较。

8. Wangwen 接入

P0.1 接口对账固定 Wangwen main commit 2e2c200。2025 年 1,122,222 行显式预测、五日收益和 benchmark 注入已与独立 IC/Rank IC 计算对账通过。

工具开发完成不等于本项目回测完成。P1 权威实验 20260723T014153 已完成 B2/B3/B4 各 2,238,748 行 2024-2025 样本外预测、统一 10bp 成本评估、Wangwen 对账和市场状态消融。最稳健的结果是复杂度与收益不单调:Elastic Net 在 R2 和 Top 成本后均值上保持领先;B3 的 Rank IC 仅在单 seed 下小幅描述性领先,B4 未优于公平重跑 B2/B3。每轮正式实验继续记录 Wangwen commit SHA、模型 commit、数据版本、配置和随机种子。

模型预测输出:

字段含义
datetime模型形成信号的交易日 t
code股票代码
value预测分数或预测收益

Wangwen 默认 close 快捷回测与本项目标签不一致。正式评估需单独计算 t+1 收盘至 t+6 收盘收益并对齐到信号日 t,再通过 BacktestEngine 直接注入预测、收益与 benchmark。

Wangwen 后续跟踪 issue #28(换手率/交易成本)、#29(聚源复权 OHLCV/成交额)和 #30(历史交易状态);均不阻塞已完成的 P0.1。

9. 已完成的计划外补充验证

以下工作扩展证据边界,但不替换 P0.2/P1 权威运行,也不回填主表:

  1. P0.2 setting 诊断与传统模型小网格: 检查 B0/B1 拟合、B1 早停、B2 延长训练和特征重要性;调优结果保留为 post-hoc 补充;
  2. P1 CUDA 跨硬件复跑 20260723T093456 在 NVIDIA A40 上按同一数据、seed、预算和完整测试区间复跑 B2/B3/B4,主要结论未因硬件变化反转;
  3. B3/B4 事后调优 20260723T105957-posthoc-b3b4 完成 10 个验证期候选和两个 winner 的完整测试,但候选网格设计晚于权威测试结果查看;
  4. B0-M/B1-M 20260723T133208-posthoc-b0m-b1m 增加配对 control;B0-M 无实质增量,B1-M 的 Rank IC 改善伴随 ICIR 下降和验证/测试方向反转;
  5. 证据与评估增强: 保存 preregistration、输入/源码/预测哈希、失败台账和冻结快照,完成独立指标对账与 CPU/CUDA 双端验证。

这些补充实验没有消除单 seed、已查看测试区间、重叠五日收益和简化交易约束带来的证据限制。

10. 分阶段状态与当前优先级

P0.0-P1:权威研究闭环

P0.0 工具、P0.1 数据、P0.2 基线与 P1 创新均已完成。权威运行固定为 20260722T09320220260723T014153,不覆盖旧结果,不依据测试结果继续调参。

P2:展示闭环(进行中)

已完成正式图表、B2-B4 可编辑架构图、专家修订版 13 页论文 build、12 页 Beamer/PPTX、逐页讲稿、26 项 Q&A 和网站页面。研究测试 54 项通过,网站 Astro check/build 为 0 错误、0 警告。

当前仍需:

  • 将最新稳定论文、Beamer、PPTX、逐页预览和 SHA256 清单同步到 workspace 稳定路径与 P2成果/
  • 由实际讲述者完成至少两次完整计时彩排,并记录实测时长、断点、翻页、问答反馈和复验结果;
  • 保持单 seed 差异为描述性证据,不把 B4 的 CLS 信息瓶颈、状态信号强度或训练抽样写成已证实原因。

P2.1:多 seed 稳健性(待启动)

多 seed 是当前最高优先级研究缺口,必须新建独立运行,禁止覆盖 20260723T014153

  1. B2、B3、B4 使用同一组至少 5 个预注册 seed、相同数据投影、训练预算、验证选择规则和完整测试键;
  2. 逐 seed 报告 R2、Rank IC、日度未年化 ICIR、成本后收益和换手,并汇总均值、标准差及三组配对差异;
  3. 日频差异采用考虑时间相关性的配对区间或稳健标准误,不以单次最佳 seed 下结论;
  4. 因 2024-2025 测试结果已被查看,本轮标记为 post-hoc;真正确认性结论仍需预注册的新样本外区间;
  5. 本轮不同时修改 B4 结构、扩大候选网格或加入 cross-attention。

答辩交付与多 seed 补充并行管理:多 seed 不阻塞 2026-07-25 材料交付,但它是升级研究结论的前置条件。

11. 本期边界

本期不做股票轴/时间 Transformer、GNN、MoE、排序损失、端到端组合优化、大规模调参和复杂 SHAP。后续增强应优先新样本外区间、非重叠组合、完整交易约束与状态差异统计推断,不以增加更多结构变体替代稳健性证据。

12. P2 验收标准

  • 论文可从干净目录一次编译成功,无缺图、缺表、未解析引用或明显溢出;
  • B2/B3/B4 架构图与实际实现一致,图源可编辑;外部素材有来源和许可记录;
  • 所有数字和结果图可追溯到正式实验,论文、网站和 Pre 使用同一组指标与谨慎结论;
  • 明确区分预测能力、重叠五日收益比较指标与可交易净值;
  • 10-12 页 Pre、讲稿和 Q&A 齐全,并完成至少两次真人计时彩排;
  • 多 seed 至少包含 5 个共同 seed 的逐 seed 产物、汇总表和配对统计,原单 seed 结果继续保留并列报告。