返回博客
隐含因子模型教我重新认识 A 股的风险结构
毕业论文笔记:PCA、IPCA 与条件自编码器的对比,以及它们各自揭示的中国市场特征。
2026-02-188 分钟阅读
Asset PricingMachine Learning
在我的本科毕业论文中,我在 1996 至 2023 年的 A 股数据上构建并对比了三种隐含因子模型——PCA、Instrumented PCA(IPCA)和条件自编码器,使用了 91 项公司特征。结论在文献里并不新鲜,但在中国数据上呈现的质感确实不同。
每个模型实际恢复了什么
- PCA 恢复出一个市场因子和一个偏市值的第二主成分,但大部分按特征分层的组合定价并不理想。
- IPCA 通过把因子载荷工具化到特征上,捕获的盈利因子和投资因子在结构上与 Fama-French 五因子类似。
- 条件自编码器在样本外的夏普和定价误差上都明显领先——这个优势是真实的,不是表面文章。
A 股让我意外的地方
在中国市场上,盈利因子和市值因子在隐含结构中远比美国数据更干净。相反,投资因子在中国弱得多——很可能因为历史上的上市群体偏向于那些不依赖外部融资(教科书意义上)的公司。
我会提醒同行注意的地方
- 自编码器模型对训练 / 验证集划分极其敏感——一次 regime 切换就能翻转它与 IPCA 的排序。
- 不要只看因子载荷来解读隐含因子;务必把它投影到可观测的特征组合上。
- 在 A 股上,样本外意味着 2021 年之后,包含 2022 年的风格切换。如果你的模型没撑过那段,那它就不算稳健。
无法命名的隐含因子依然是因子。危险在于相信它会持续。
我下一步想做的
下一步是把自编码器与市场状态调节器结合起来——大概率是基于风格动量特征的隐马尔可夫模型——让隐含结构可以随 regime 切换,而不是全局估计。这是我研究生阶段的方向。