标签: 机器学习
模型训练-正则化:别让模型死记硬背上一篇讲了损失函数与优化器但是训练参数
模型训练-正则化:别让模型死记硬背上一篇讲了损失函数与优化器但是训练参数不能只看预测对错,还要约束参数不要过大。总式:Loss_total=Loss_task+λ·Ω(w)。惩罚项像山谷,最低点在w=0,坡度就是往0拉的力。(1)L1惩罚|w|,V字山谷,拉力恒定。不重要特征易被一路拉到w=0→稀疏,可做特征选择;深度学习很少单独用。(2)L2惩罚w²,抛物线山谷,拉力∝|w|。大权重猛拉,靠近0几乎松手→权重趋近0,一般不为0;处处可导,神经网络常用。(3)WeightDecay目标与L2相同(压大权重),但不改损失,每步更新前先把权重缩一圈。SGD下二者近似等价;Adam下不等价:不要往损失里硬加L2,用Adam又要衰减时应选AdamW。两篇总结:损失函数:输出端衡量对错,给出误差信号。优化器:按梯度更新权重,决定怎么下山。正则:约束权重别太大,防过拟合。下一篇:激活函数:决定网络能不能学复杂规律AI不焦虑howto多元化思维模型智能体人工智能深度学习大模型机器学习