超参数调优入门:网格、随机与贝叶斯
超参数是模型训练前就要定好的旋钮,例如学习率、树的数量、正则强度。选得好坏直接影响最终精度。调优的目标是:在有限预算内找到一组好超参。
先弄清概念
- 超参数 vs 参数:参数由训练学到,超参数在训练前设定。
- 典型超参数:学习率、批量大小、迭代轮数、正则系数、网络宽度深度、树的数量与深度。
- 关键原则:用验证集选超参,测试集只评估一次,否则会「过拟合到测试集」。
网格搜索(Grid Search)
- 枚举每个超参的几个候选值,做全组合,跑完全部再选最优。
- 优点:简单、可复现;缺点:维度一多组合爆炸,成本随参数个数指数增长。
随机搜索(Random Search)
- 在超参取值范围内随机采样若干组分别训练。
- 相比网格,同样预算下更能覆盖「重要超参的不同取值」,实践中往往更划算(Bergstra 等人的研究结论,已核验)。
- 适合参数多、预算有限的场景。
贝叶斯优化(Bayesian Optimization)
- 用一个代理模型(如高斯过程)拟合「超参到分数」的关系,每轮挑最有潜力的点试验,逐步逼近最优。
- 代表工具:Optuna、Hyperopt 等(标已核验/待核实)。
- 优点:样本效率高,适合训练昂贵的深度学习;缺点:实现复杂、并行性受限。
落地注意
- 先粗后细:先用随机搜索圈范围,再在最优附近精调。
- 固定其他变量,每次只动少数几个超参,便于归因。
- 把「早停」与调优结合,省下大量无效训练时间。
小结
超参数调优的核心是「在预算内高效探索」。随机搜索是性价比之选,贝叶斯优化适合昂贵训练,网格搜索适合少量参数。别忘了用验证集选参、测试集只验一次。
参考与延伸阅读
- Random Search for Hyper-Parameter Optimization,JMLR 2012(已核验)
- Optuna 官方文档(待核实最新版)
- 本站「模型评估指标」与「特征工程入门」教程
本文累计阅读 — 次