Ruta de aprendizaje Avanzado
Optimización avanzada de redes neuronales
Más allá del descenso de gradiente básico: momentum, Nesterov, AdaGrad y RMSProp, Adam y AdamW, la programación de la tasa de aprendizaje y los métodos de segundo orden.
- 6 recursos
- 2 visitas
- ~50 min
Esta ruta de aprendizaje explica cómo funcionan y por qué se usan los optimizadores modernos del deep learning, desde el momentum clásico hasta los métodos de segundo orden, pensada para quienes ya dominan el descenso de gradiente básico y quieren entender qué hay detrás de Adam, AdamW o un warmup de tasa de aprendizaje.
Qué vas a poder hacer al terminar
Al final de la ruta sabrás explicar y elegir con criterio el optimizador adecuado para cada problema: qué técnica acelera el entrenamiento, cuándo conviene una tasa adaptativa y cómo diagnosticar un entrenamiento que oscila o se estanca. Es un recorrido de nivel avanzado: da por hecho que ya conoces el descenso de gradiente, la retropropagación y el álgebra matricial básica de una red neuronal.
Cómo se construye el recorrido
Empieza con el momentum en el descenso de gradiente, la idea de acumular velocidad en la dirección del gradiente para amortiguar el zigzag en superficies de error alargadas. A partir de ahí, el gradiente acelerado de Nesterov (NAG) corrige una limitación del momentum clásico al mirar «un paso por delante» antes de calcular el gradiente. La ruta sigue con AdaGrad y RMSProp, que introducen tasas de aprendizaje adaptativas por parámetro, y culmina en Adam y AdamW, el optimizador por defecto de facto en el deep learning actual porque combina momentum y adaptación. Cierra con la programación de la tasa de aprendizaje (schedules y warmup) y con los métodos de segundo orden derivados de Newton, que aprovechan la curvatura en lugar de solo la pendiente.
Adam se ha citado en más de 100.000 artículos desde su publicación en 2015, prueba de cuánto ha marcado esta familia de optimizadores el entrenamiento moderno de redes neuronales.
El momentum en el descenso de gradiente
El momentum es una mejora del descenso de gradiente que acumula una velocidad a partir de los gradientes anteriores en lugar de mirar solo el actual. Con un coeficiente β cercano a 0,9, esa inercia suaviza el zigzag del SGD puro, atraviesa los valles alargados y hace que el entrenamiento converja bastante más rápido.
El gradiente acelerado de Nesterov (NAG)
El gradiente acelerado de Nesterov mejora el momentum clásico calculando el gradiente en un punto adelantado, el que la inercia va a alcanzar, en lugar del punto actual. Ese paso de anticipación corrige la trayectoria antes de pasarse y logra una convergencia O(1/k²) en problemas convexos suaves, la más rápida posible para un método de primer orden.
AdaGrad y RMSProp, tasas de aprendizaje adaptativas
AdaGrad y RMSProp son optimizadores que dan a cada peso su propia tasa de aprendizaje. AdaGrad acumula el cuadrado de todos los gradientes y divide el paso por su raíz, lo que la apaga con el tiempo. RMSProp lo corrige con una media móvil que olvida el pasado con un factor de 0,9.
Adam y AdamW, el optimizador por defecto del deep learning
Adam combina el momento de primer orden (media móvil del gradiente) y el de segundo orden (media de sus cuadrados) para dar a cada parámetro su propia tasa de aprendizaje. Con la corrección de sesgo y los valores por defecto β1=0,9, β2=0,999 y ε=1e-8, converge rápido y casi sin ajustar nada.
Programación de la tasa de aprendizaje (schedules y warmup)
La programación de la tasa de aprendizaje cambia el valor de η a lo largo del entrenamiento en lugar de dejarlo fijo. Empieza con un calentamiento que sube η desde casi cero, mantiene un pico y después la reduce con decaimiento por pasos, exponencial o coseno para converger más rápido y con menos oscilación.
Métodos de segundo orden, Newton y sus aproximaciones
Los métodos de segundo orden usan la hessiana, la matriz de segundas derivadas de la pérdida, para orientar mejor cada paso que el gradiente solo. El método de Newton actualiza los pesos restando la inversa de la hessiana por el gradiente, pero invertirla es demasiado costoso en redes grandes, así que se recurre a aproximaciones cuasi-Newton.