大A的根本属性:国民经济运行 + 经济情绪的反应
最近一直在想一个问题:用 RandomForest、XGBoost 这些纯数据驱动的模型做 A 股预测,本质上到底在做什么?
它们只是在根据历史数据,计算未来某种走势的概率。换句话说,它们默认了过去发生的规律会在未来重复。
但这真的够吗?
Definitely Not。
如果你要预测的是一个经济体运行状态和市场情绪变化的系统,只看它自己过去的价格数据,是远远不够的。这大概也是之前做模型时总觉得"哪里不对劲"的根本原因。
不要用数据预测数据
金融系统本身就是一个巨大的混沌系统。股价不是由股价自己决定的,而是由无数外部因素共同作用的结果:
- 宏观经济数据
- 货币政策与财政政策
- 行业技术突破(比如新模型发布)
- 地缘政治事件
- 市场参与者情绪
- 资金流向与板块轮动
所以,正确的思路不是"用数据本身预测数据",而是找到"外部因素如何作用于市场"的连接关系。
因子挖掘的本质
这就是"发掘因子"的真正含义:
从数据中找到能够稳定区分未来涨跌的信号。
这些信号不一定来自价格本身,而来自价格背后的驱动因素。比如:
- 政策面:降准降息、产业政策出台、监管态度
- 技术面:RSI 超卖超买、MACD 金叉死叉、均线排列
- 情绪面:市场情绪指数、成交量异动、恐慌/贪婪指标
- 事件面:新科技模型发布、财报季、地缘冲突
- 资金面:北向资金流向、ETF 申赎、融资融券余额
结论
未来的重点不应该放在"用更复杂的模型拟合历史价格"上,而应该放在:
如何把外部信息(政策、情绪、事件、资金)有效地转化为可量化的因子,并验证这些因子对未来涨跌的稳定区分能力。
否则,模型再复杂,也不过是在历史的噪音里过度拟合。