Categorías

Inteligencia Artificial

La normalización de capa (layer normalization) y sus variantes

La normalización de capa estabiliza el entrenamiento normalizando cada ejemplo por separado, con la media y la desviación típica de sus propias activaciones. A diferencia de la normalización por lotes, no depende del tamaño del lote, y por eso los transformers la adoptaron. RMSNorm es su variante más ligera y extendida hoy.

Inteligencia Artificial

Programación de la tasa de aprendizaje (schedules y warmup)

La programación de la tasa de aprendizaje cambia el valor de η a lo largo del entrenamiento en lugar de dejarlo fijo. Empieza con un calentamiento que sube η desde casi cero, mantiene un pico y después la reduce con decaimiento por pasos, exponencial o coseno para converger más rápido y con menos oscilación.

Inteligencia Artificial

La función de activación GELU en redes neuronales

La función GELU (Gaussian Error Linear Unit) multiplica cada valor de entrada por la probabilidad de que la normal estándar sea menor que ese valor. El resultado es una curva suave, con derivada continua, que pesa las entradas por su magnitud y se ha convertido en la activación por defecto de BERT y GPT.