Categorías

Inteligencia Artificial

La normalización por lotes (batch normalization)

La normalización por lotes (batch normalization) es una técnica que normaliza las activaciones de cada capa usando la media y la varianza del minilote, y después las reescala con dos parámetros aprendibles, gamma y beta. Introducida en 2015, permite tasas de aprendizaje más altas, acelera el entrenamiento y estabiliza las redes profundas.

Inteligencia Artificial

Programación de la tasa de aprendizaje (schedules y warmup)

La programación de la tasa de aprendizaje cambia el valor de η a lo largo del entrenamiento en lugar de dejarlo fijo. Empieza con un calentamiento que sube η desde casi cero, mantiene un pico y después la reduce con decaimiento por pasos, exponencial o coseno para converger más rápido y con menos oscilación.

Inteligencia Artificial

Descenso de gradiente por lotes, estocástico y mini-batch

El descenso de gradiente por lotes usa todos los datos en cada paso, el estocástico usa una sola muestra y el mini-batch escoge un grupo intermedio, casi siempre de 32 a 256 ejemplos. Esta guía compara las tres variantes, su coste, su ruido y por qué el mini-batch se ha convertido en el estándar del entrenamiento.

Inteligencia Artificial

Qué es una función de pérdida y una función de coste

Una función de pérdida mide cuánto se equivoca una red neuronal en un solo ejemplo, comparando su predicción con el valor correcto. La función de coste promedia esa pérdida sobre todo el conjunto de datos. Ese número único es el que el entrenamiento intenta reducir paso a paso con el descenso de gradiente.