上一篇有人问:机器学习跑出来的信号,不算因子的话,怎么判断?是一个很棒的问题!
可以不把它当成一个“关系”来看,而是拆成两层分开测。
因子问的是这个关系还在不在。ML 信号得问两个问题:输入分布变了吗,以及输入没变的情况下,预测和实现的校准还准不准。前者是特征分布的滚动监控,后者是 calibration curve。
分开测之后,诊断其实比想象中清楚。输入漂了但校准还稳,说明环境变了、模型还能用。输入稳而校准恶化,说明被抹平了,通常意味着有人在做同一件事。所谓黑盒失效无法归因,很多时候只是因为盯着净值曲线,没把这两层拆开。
特征层面也不是完全说不出话。模型整体讲不了逻辑,但把权重最大的十几个特征拎出来,参与者结构、规则、同类资金那三个问题照样可以问,只是对象从因子换成了特征。
还有一点跟周期有关。月频的股票因子要跑几年才能统计显著,所以逻辑在那里是拿来抢时间的。做市和短周期预测的样本量不一样,edge per trade 的滚动分布在天级就能给出挺窄的区间,本身就是一个 monitor。上一篇说的“没有逻辑就不知道自己怎么死的”,在这个周期上其实要弱不少。
另外一个容易混的地方:做市里的短周期预测不是独立 alpha,是报价的一部分。它的价值应该在 PnL 归因里看,adverse selection 降了多少、fill quality 好了多少,而不是单独算 IC 或 Sharpe。这两个口径经常给出相反的结论。
真正替代不了逻辑的,是判断敢不敢外推。碰到训练集里没有的状态,市场结构变了、波动到了没见过的水平、规则调整,统计监控是滞后的。这种时候要不要让模型继续跑,只能靠对机制的理解。
显示更多