因子选股的核心评估指标——IC与Rank IC
信息系数 (IC) 在衡量什么?
信息系数(Information Coefficient, IC)衡量的是:在某个截面上,你用因子(或模型打分)给股票排序 / 定量之后,这份「预测」与随后实现的收益有多一致。
一句话:IC 高 ≠ 明天一定涨;而是预测顺序与未来收益顺序是否经常同向。
实现方式上,IC 通常是横截面相关系数:每个交易日算一次,得到一条随时间变化的 IC 序列;再在时间上取均值、标准差,得到 IC 均值、ICIR 等汇总量。
两种常用 IC
-
Pearson IC
因子值与未来收益的线性相关系数。对极端值、量纲敏感;因子长尾或未被 winsorize 时,单日 IC 波动可能很大。 -
Rank IC(Spearman IC)
先把因子与未来收益换成**秩(排名)**再算相关。更关心「谁比谁好」,对单调关系稳健,业界因子检验更常用 Rank IC。
标签要对齐:IC 在预测谁?
IC 定义里最关键的是「未来收益」怎么定:不同 label 下,IC 的符号与可比性都不同。Qlib 默认 Alpha158 常用标签形如:
Ref($close, -2) / Ref($close, -1) - 1
即用 T+1 相对 T+2 的收益率这类前瞻收益(具体取决于数据与交易约定),本质是「下一持有期的收益」,而不是「下一个 tick」。
在自己改标签或看论文时,务必核对:高因子值对应的是预测高收益还是高异常收益,再解读 IC 正还是负。
IC 与 ICIR 怎么读
业界常用的经验区间(因市场、频率、样本而异,仅作数量级参考;不必当硬阈值):
- |IC| 或 |Rank IC| 若是日频横截面,0.05 量级已常被视为很强;0.01~0.03 也可能在成本控制得好时有用。
- ICIR = IC 序列的 均值 / 标准差,刻画「预测能力是否稳定」:同样平均 IC,波动越小 ICIR 越高,过拟合与「靠几天极端日子撑起来」的风险相对低。
注意:
- 单期 IC 噪声极大:要看滚动均值、累计 IR、分层多空等,而不是盯某一天。
- 换手率与衰减:IC 高但因子每天都在剧变,加上成本可能无法变现;评估时往往要结合换手、持有期与交易成本(可在回测层看)。
- 与面板展示的关系:因子页上的整体 IC / Rank IC 多来自当前实验里对模型信号或合成因子的检验,不是给 Alpha158 每一列各算一条 IC;要逐因子诊断需在研究脚本中单独跑。
实操检查清单(避免误用)
- 无偷看:特征仅用当前交易日及过去信息;收益用真正实现价与可实现持有期。
- 样本切分:训练 / 验证 / 测试时间段严格分开;IC 在测试段断崖下跌 = 典型过拟合信号。
- 中性化与风险:行业、市值、风格可能「假增」IC;正式论文与资管流程里常与中性化、风险模型一起报告。
- Rank vs Pearson:对外对比时说明用的是哪一种;比较 Rank IC 与 Pearson IC 差异过大时,先查极端值与分布。
延伸阅读
- 因子体系与特征来源:《Alpha 因子体系》
- 风险调整收益:《夏普比率详解》、《卡玛比率与风险评估》
- 学习顺序:《学习目标与学习路径》阶段 2~3
小结
IC / Rank IC 度量的是预测截面与未来收益截面的一致性;默认配置下要与 Qlib 的 label 定义对齐再谈正负。报告 IC 均值 + ICIR + 时间稳定性 比单日 IC 更有意义;单因子诊断需要在研究流程里单独计算,本面板侧重模型级汇总展示时可留意脚注说明。