La Función Unidad Rectificada Uniforme (RELU): Una Herramienta Esencial para el Aprendizaje Profundo
Índice de contenidos
- Puntos clave
- Cómo funciona ReLU
- Por qué superó a sigmoide y tanh
- Aplicaciones en aprendizaje profundo
- El problema dying ReLU
- Preguntas frecuentes
- ¿Por qué se llama Unidad Lineal Rectificada y no Unidad Rectificada Uniforme?
- ¿Cuándo conviene usar Leaky ReLU en lugar de ReLU estándar?
- ¿ReLU se usa también en la capa de salida?
- Conclusión
- Fuentes
ReLU (Unidad Lineal Rectificada, f(x) = max(0, x)) es la función de activación dominante en el aprendizaje profundo desde que AlexNet la popularizó en 2012: barata de calcular, resistente al desvanecimiento del gradiente y con una debilidad conocida, el dying ReLU.
ReLU (siglas de Rectified Linear Unit, en español Unidad Lineal Rectificada, no «Uniforme») es la función de activación f(x) = max(0, x). Devuelve la entrada tal cual si es positiva y cero si es negativa. Esta regla es más barata de calcular que sigmoide o tanh y resiste el desvanecimiento del gradiente. Eso la convirtió en la función de activación por defecto del aprendizaje profundo moderno desde que AlexNet la popularizó en 2012.
Esta guía también está disponible en inglés: The Rectified Linear Unit (ReLU): An Essential Tool for Deep Learning.
Puntos clave
- ReLU se define como f(x) = max(0, x): la operación más barata posible como función de activación no lineal.
- Popularizada por AlexNet (2012), marcó el inicio del aprendizaje profundo moderno.
- Evita el desvanecimiento del gradiente que afecta a sigmoide y tanh en redes profundas.
- Su principal debilidad es el «dying ReLU»: neuronas que se desactivan permanentemente, problema que Leaky ReLU mitiga.
- Sigue siendo la función por defecto en las arquitecturas de visión y NLP de referencia.
Cómo funciona ReLU
La función ReLU se define matemáticamente como:
f(x) = max(0, x)
Su comportamiento:
- Para x > 0: la salida es x (función identidad).
- Para x ≤ 0: la salida es 0 (la neurona no transmite señal).

La siguiente visualización interactiva traza ReLU junto a su derivada, que vale 1 para x > 0 y 0 para x < 0 (en x = 0 no está definida):
La elegancia de ReLU es que no hay exponenciaciones, ni divisiones, ni saturaciones: en una GPU procesando millones de activaciones por segundo, la diferencia de coste frente a sigmoide es enorme.
Por qué superó a sigmoide y tanh
Antes de ReLU, la función sigmoide y la tangente hiperbólica dominaban. Ambas tienen el mismo problema en redes profundas: saturación y desvanecimiento del gradiente.
Cuando una sigmoide recibe entradas grandes o pequeñas, su derivada se aproxima a cero. Al multiplicar gradientes capa a capa (regla de la cadena), el gradiente llega prácticamente extinguido a las primeras capas. ReLU no satura en la región positiva, por lo que el gradiente fluye sin atenuarse.
Tres razones concretas de su adopción masiva:
- Velocidad de entrenamiento: convergencia 6 veces más rápida que tanh en experimentos de AlexNet.
- Activaciones dispersas: en cualquier instante, las neuronas con entrada negativa devuelven 0, generando representaciones más compactas.
- Facilidad de implementación: un
max(0, x)existe en cualquier framework.
Aplicaciones en aprendizaje profundo
ReLU es la función de activación estándar en la práctica:
- Clasificación de imágenes: AlexNet (2012), VGG, ResNet usan ReLU en todas sus capas convolucionales.
- Procesamiento de lenguaje natural: los transformers modernos usan GELU y SiLU, variantes suaves de la idea de ReLU.
- Reconocimiento de voz: arquitecturas deep speech usan ReLU en capas densas intermedias.
- Redes generativas (GAN): el generador usa ReLU o Leaky ReLU por defecto en sus capas ocultas.

En el contexto de análisis de imágenes con visión computarizada, ReLU aparece en prácticamente todas las arquitecturas convolucionales. Los modelos pre-entrenados que se usan como base en transfer learning llevan ReLU o sus variantes en las capas de extracción de características.
Para el aprendizaje por refuerzo, ReLU es también el valor por defecto de las redes de política y valor en las implementaciones de referencia.
El problema dying ReLU
Su única debilidad estructural: si una neurona recibe entradas negativas de forma consistente, su salida es siempre 0 y su gradiente también. Esa neurona deja de aprender permanentemente.
Soluciones establecidas:
- Leaky ReLU: sustituye el 0 por αx con α pequeño (ver artículo completo sobre Leaky ReLU).
- ELU (Exponential Linear Unit): curva suave para x < 0.
- GELU: usado en BERT y GPT, aproxima ReLU con una curva gaussiana.
- Inicialización cuidadosa de pesos: He initialization reduce la probabilidad de dying ReLU desde el inicio.
Preguntas frecuentes
¿Por qué se llama Unidad Lineal Rectificada y no Unidad Rectificada Uniforme?
Porque la función no es uniforme: es lineal solo a partir de cero (f(x) = x para x > 0) y constante en cero para el resto. «Rectificada» viene de la electrónica, donde un rectificador deja pasar solo la parte positiva de una señal; ReLU hace exactamente eso con las activaciones de la red.
¿Cuándo conviene usar Leaky ReLU en lugar de ReLU estándar?
Cuando el ritmo de aprendizaje es alto o la red es profunda, sube el riesgo de dying ReLU. Leaky ReLU sustituye el cero por una pendiente pequeña (por ejemplo 0.01x) en la parte negativa, así que ninguna neurona queda completamente muerta.
¿ReLU se usa también en la capa de salida?
Casi nunca. En las capas ocultas es la opción por defecto. La capa de salida, en cambio, suele usar softmax para clasificación multiclase o una función lineal para regresión: ahí interesa una distribución de probabilidad o un valor sin recortar, no una activación dispersa.
Conclusión
ReLU es la función de activación que democratizó el aprendizaje profundo. Su coste computacional mínimo, su resistencia al desvanecimiento del gradiente y su compatibilidad con arquitecturas de cientos de capas la convirtieron en el estándar de la industria. Entender sus fortalezas y el problema dying ReLU es imprescindible para cualquier profesional que diseñe o ajuste redes neuronales profundas.
Fuentes: Glorot, Bordes y Bengio, «Deep Sparse Rectifier Neural Networks» (AISTATS 2011)[1], documentación de PyTorch sobre torch.nn.ReLU[2], documentación de TensorFlow sobre tf.keras.activations.relu[3], notas de Stanford CS231n sobre funciones de activación[4].