Categorías

Ruta de aprendizaje Avanzado

Estabilidad, inicialización y regularización

Lo que mantiene estable a una red profunda: la inicialización de pesos (Xavier/Glorot y He), la normalización por lotes y de capa, y el dropout.

  • 4 recursos
  • 2 visitas
  • ~33 min

Qué aprenderás en esta ruta

Esta ruta explica qué mantiene estable el entrenamiento de una red neuronal profunda: cómo inicializar los pesos, cómo normalizar las activaciones capa a capa y cómo evitar el sobreajuste con dropout. Está pensada para quien ya domina retropropagación y descenso de gradiente y quiere entender por qué una red profunda diverge, deja de aprender o generaliza mal.

Qué sabrás hacer al terminar

Al final serás capaz de diagnosticar gradientes que se desvanecen o explotan, elegir la inicialización adecuada según la función de activación de cada capa, y decidir entre batch normalization y layer normalization según el problema. Es una ruta de nivel avanzado: exige soltura con álgebra matricial, cálculo de gradientes y las bases del entrenamiento de redes neuronales.

Cómo se construye la secuencia

Arranca por la inicialización de pesos con los esquemas de Xavier/Glorot y He, que fijan la varianza inicial de cada capa para que la señal no se apague ni se dispare en las primeras pasadas hacia adelante y hacia atrás. A partir de ahí pasa a la normalización por lotes, la técnica que recalibra las activaciones durante el entrenamiento y que hizo posible entrenar redes mucho más profundas de lo habitual antes de 2015. Después compara la normalización de capa y sus variantes, la alternativa que domina en los transformers y en tareas con lotes pequeños o secuencias de longitud variable. Cierra con dropout y su interpretación matemática, la técnica de regularización que apaga neuronas al azar durante el entrenamiento y que puede leerse como una forma de promediar un conjunto de subredes.

Inteligencia Artificial

Inicialización de pesos, Xavier/Glorot y He

La inicialización de pesos fija la escala de los valores iniciales de la matriz W antes de entrenar. Xavier/Glorot, de 2010, reparte la varianza entre entradas y salidas y sirve para sigmoide y tanh; He, de 2015, la duplica para ReLU, que anula la mitad de las activaciones. Elegir mal frena o rompe el aprendizaje.

Inteligencia Artificial

La normalización por lotes (batch normalization)

La normalización por lotes (batch normalization) es una técnica que normaliza las activaciones de cada capa usando la media y la varianza del minilote, y después las reescala con dos parámetros aprendibles, gamma y beta. Introducida en 2015, permite tasas de aprendizaje más altas, acelera el entrenamiento y estabiliza las redes profundas.

Inteligencia Artificial

La normalización de capa (layer normalization) y sus variantes

La normalización de capa estabiliza el entrenamiento normalizando cada ejemplo por separado, con la media y la desviación típica de sus propias activaciones. A diferencia de la normalización por lotes, no depende del tamaño del lote, y por eso los transformers la adoptaron. RMSNorm es su variante más ligera y extendida hoy.

Inteligencia Artificial

Dropout y su interpretación matemática

El dropout es una técnica de regularización que desactiva neuronas al azar durante el entrenamiento, con probabilidad de retención p, y divide las activaciones supervivientes entre p para conservar su escala. En inferencia la red completa actúa sin apagar nada. Matemáticamente equivale a promediar un ensemble enorme de subredes que comparten pesos.