Skip to content
王佳晨
返回博客

隐含因子模型教我重新认识 A 股的风险结构

毕业论文笔记:PCA、IPCA 与条件自编码器的对比,以及它们各自揭示的中国市场特征。

2026-02-188 分钟阅读
Asset PricingMachine Learning

在我的本科毕业论文中,我在 1996 至 2023 年的 A 股数据上构建并对比了三种隐含因子模型——PCA、Instrumented PCA(IPCA)和条件自编码器,使用了 91 项公司特征。结论在文献里并不新鲜,但在中国数据上呈现的质感确实不同。

每个模型实际恢复了什么

  • PCA 恢复出一个市场因子和一个偏市值的第二主成分,但大部分按特征分层的组合定价并不理想。
  • IPCA 通过把因子载荷工具化到特征上,捕获的盈利因子和投资因子在结构上与 Fama-French 五因子类似。
  • 条件自编码器在样本外的夏普和定价误差上都明显领先——这个优势是真实的,不是表面文章。

A 股让我意外的地方

在中国市场上,盈利因子和市值因子在隐含结构中远比美国数据更干净。相反,投资因子在中国弱得多——很可能因为历史上的上市群体偏向于那些不依赖外部融资(教科书意义上)的公司。

我会提醒同行注意的地方

  • 自编码器模型对训练 / 验证集划分极其敏感——一次 regime 切换就能翻转它与 IPCA 的排序。
  • 不要只看因子载荷来解读隐含因子;务必把它投影到可观测的特征组合上。
  • 在 A 股上,样本外意味着 2021 年之后,包含 2022 年的风格切换。如果你的模型没撑过那段,那它就不算稳健。
无法命名的隐含因子依然是因子。危险在于相信它会持续。

我下一步想做的

下一步是把自编码器与市场状态调节器结合起来——大概率是基于风格动量特征的隐马尔可夫模型——让隐含结构可以随 regime 切换,而不是全局估计。这是我研究生阶段的方向。