启动新回测
模型与训练规模
选股模型决定如何从因子中学习。约 4 核 8G、无独显时默认用 LightGBM(省内存、训练快);深度网络可试但更慢、更吃资源。下拉里「推荐 / 慎选 / 低配不推荐」按此环境粗略标注,可视情况覆盖。
梯度提升树 — 表格数据表现优异
每期持仓的股票数量。TopK 越大持仓越分散、风险越低,但可能稀释 Alpha。A 股常用 30-100。
排名下降超过该阈值的股票才卖出。值越大,换手越低,节省交易成本,但可能错失调仓机会。建议 2-10。
模型完整遍历训练集的次数。太多会过拟合(历史好、未来差),太少学不到规律。神经网络通常 50-200,树模型 100-500。默认 200,配合早停策略防止过拟合。
数据划分(起止日期)
训练集用于模型学习规律。通常选较早的时间段,避免与测试期重叠。
训练集用于模型学习规律。通常选较早的时间段,避免与测试期重叠。
验证集用于早停(early stop)和调参。当验证集表现不再提升时停止训练,防止过拟合。
验证集用于早停(early stop)和调参。当验证集表现不再提升时停止训练,防止过拟合。
测试集模拟真实交易环境,模型从未见过这些数据。测试集的收益才是策略真实水平的参考。
测试集模拟真实交易环境,模型从未见过这些数据。测试集的收益才是策略真实水平的参考。
神经网络超参数
控制每步参数更新的步长。太大会震荡不收敛,太小收敛慢。神经网络常用 0.0001-0.01,推荐 0.001。
神经网络隐藏层的神经元数量。越大模型容量越高,但计算更慢、更容易过拟合。建议 32-128。