Ruta de aprendizaje Intermedio
La neurona y las funciones de activación
De la neurona artificial a la propagación hacia delante: pesos y sesgos, la familia completa de funciones de activación (escalón, sigmoide, ReLU, GELU, Swish, ELU, SELU, Softplus, Mish) y los problemas del gradiente.
- 20 recursos
- 2 visitas
- ~131 min
Esta ruta explica, paso a paso, cómo una neurona artificial transforma números en decisiones: qué hace exactamente cada función de activación y por qué la elección importa tanto como la arquitectura misma. Está pensada para quien ya sabe programar y quiere entender las matemáticas detrás de una red neuronal, no solo usarla como caja negra.
Qué vas a poder hacer al terminar
Al final de las 20 lecciones sabrás calcular a mano la salida de una neurona, explicar por qué una red sin funciones no lineales se colapsa en un modelo lineal, y elegir con criterio entre ReLU, GELU, Swish o Mish según el problema que estés resolviendo. El nivel es intermedio: conviene llegar con algo de álgebra básica (vectores, sumas ponderadas) y haber programado antes, aunque no hace falta experiencia previa en machine learning.
Cómo se construye el recorrido
Arranca por el perceptrón y la suma ponderada de pesos y sesgos, la base de cualquier neurona. A partir de ahí entra la pregunta central: qué es una función de activación y por qué hace falta. La ruta recorre entonces la familia completa, de la función escalón y la sigmoide clásicas a la tangente hiperbólica, ReLU y sus variantes (Leaky ReLU, GELU, Swish, ELU, SELU, Softplus, Mish) y softmax para clasificación. Cierra con una guía comparativa para elegir función según el caso, los problemas del gradiente que se desvanece y el gradiente explosivo, y termina uniendo todo en la propagación hacia delante de una red multicapa completa.
Son 20 paradas, la ruta más larga del catálogo de matemáticas de redes neuronales, y cada una parte de una fórmula concreta, no de una intuición vaga.
El perceptrón, la neurona artificial y sus matemáticas
El perceptrón es la neurona artificial más simple: recibe varias entradas, las multiplica por sus pesos, suma un sesgo y aplica una función de activación que decide entre dos salidas. Frank Rosenblatt lo presentó en 1958 y sigue siendo la pieza básica con la que se construyen las redes neuronales modernas.
Pesos, sesgos y la suma ponderada de una neurona
En una neurona artificial, los pesos miden la importancia de cada entrada y el sesgo desplaza el resultado. La neurona multiplica cada entrada por su peso, suma todo y añade el sesgo para obtener la suma ponderada z = Wx + b, el número que luego pasa por la función de activación.
Qué es una función de activación y por qué es necesaria
Una función de activación es la operación no lineal que cada neurona aplica a su suma ponderada z para producir su salida a igual a f de z. Sin ella, apilar capas solo encadena transformaciones lineales y toda la red se reduce a una sola. La no linealidad es lo que permite aprender patrones complejos.
La Función Escalón: Una Herramienta Esencial en Redes Neuronales
La función escalón o de Heaviside es la función de activación más simple de una red neuronal: convierte cualquier entrada en una salida binaria, 0 o 1, según supere o no un umbral fijo. Fue el mecanismo central del perceptrón de Rosenblatt en 1958, pero su derivada es nula en casi todo punto, por lo que hoy se sustituye por la sigmoide o la ReLU.
Función Lineal: Una Función de Activación Común
La función lineal f(x) = ax + b es la activación más simple de una red neuronal: en su forma identidad, f(x) = x, es el estándar en la capa de salida para regresión porque no acota el rango de valores posibles. En capas ocultas falla, porque componer varias funciones lineales colapsa toda la red en una única capa lineal equivalente.
La Función Sigmoide: Una Herramienta Clave en Redes Neuronales
La función sigmoide convierte cualquier número real en un valor entre 0 y 1, lo que la vuelve la función de activación natural para expresar probabilidades en una red neuronal. Es diferenciable en todo su dominio, aunque sufre saturación y desvanecimiento del gradiente en redes profundas, por lo que hoy se reserva casi siempre a la capa de salida.
La Tangente Hiperbólica: Función de Activación Potente
La tangente hiperbólica (tanh) es una función de activación que comprime cualquier valor real en el intervalo (-1, 1) con salida centrada en cero, lo que reduce el sesgo sistemático de los gradientes frente a la sigmoide. Es la activación estándar en las celdas de memoria LSTM y GRU de las redes recurrentes.
La Función Unidad Rectificada Uniforme (RELU): Una Herramienta Esencial para el Aprendizaje Profundo
ReLU (Unidad Lineal Rectificada, f(x) = max(0, x)) es la función de activación dominante en el aprendizaje profundo desde que AlexNet la popularizó en 2012: barata de calcular, resistente al desvanecimiento del gradiente y con una debilidad conocida, el dying ReLU.
La Función Leaky ReLU y su papel en las Redes Neuronales
Leaky ReLU es una función de activación derivada de ReLU que sustituye el valor cero de las entradas negativas por una pendiente pequeña, normalmente 0.01. Así el gradiente nunca es exactamente cero, lo que evita el problema de la neurona muerta y estabiliza el entrenamiento en redes convolucionales, recurrentes y GAN muy profundas.
Función SoftMax: Activación para la clasificación
La función Softmax transforma los logits de salida de una red neuronal en una distribución de probabilidad que suma 1. Es la activación estándar en clasificación multiclase, desde clasificadores de imágenes hasta el vocabulario de los modelos de lenguaje como GPT.
La función de activación GELU en redes neuronales
La función GELU (Gaussian Error Linear Unit) multiplica cada valor de entrada por la probabilidad de que la normal estándar sea menor que ese valor. El resultado es una curva suave, con derivada continua, que pesa las entradas por su magnitud y se ha convertido en la activación por defecto de BERT y GPT.
La función de activación Swish (SiLU)
La función Swish, también llamada SiLU, multiplica la entrada por su sigmoide: swish(x) = x·σ(x). Es suave, no monótona y se autorregula, por lo que suele superar a ReLU en redes profundas. Modelos como LLaMA y EfficientNet la usan como activación por defecto.
La función de activación ELU (Exponential Linear Unit)
La función ELU (Exponential Linear Unit) devuelve x cuando la entrada es positiva y α(eˣ−1) cuando es negativa. Al permitir valores negativos suaves, acerca a cero la media de las activaciones, acelera la convergencia frente a ReLU y evita las neuronas muertas gracias a un gradiente que nunca se anula del todo.
La función SELU y las redes autonormalizadas
La función SELU (Scaled Exponential Linear Unit) se define como SELU(x) igual a lambda por ELU(x), con lambda cercano a 1,0507 y alfa cercano a 1,6733. Esas dos constantes hacen que las activaciones converjan solas hacia media cero y varianza uno capa tras capa, y crean redes profundas que se normalizan a sí mismas sin batch normalization.
La función de activación Softplus
La función Softplus se define como softplus(x) = ln(1 + eˣ): una aproximación suave y siempre positiva de ReLU cuya derivada es exactamente la sigmoide. Es derivable en todo su dominio, evita el vértice anguloso de ReLU y su salida nunca llega a cero del todo.
La función de activación Mish
La función Mish se define como mish(x) = x·tanh(softplus(x)). Es suave, no monótona y se autorregulariza, propiedades que le permiten superar a Swish y a ReLU en muchas pruebas. El detector de objetos YOLOv4 la adoptó en su columna vertebral como activación por defecto.
Cómo elegir una función de activación (comparativa)
Elegir una función de activación es sencillo con una regla base: usa ReLU en las capas ocultas, GELU o SiLU en transformers y reserva la salida para softmax en clasificación multiclase, sigmoide en problemas binarios y una activación lineal en regresión. Esta comparativa reúne fórmulas, rangos y casos de uso.
El problema del gradiente que se desvanece
El gradiente que se desvanece aparece cuando la señal de error se encoge al retropropagarse por muchas capas. Las funciones sigmoide y tangente hiperbólica tienen derivadas pequeñas, y su producto tiende a cero, así que las primeras capas apenas aprenden. ReLU, una buena inicialización y la normalización resuelven el problema.
El problema del gradiente explosivo
El gradiente explosivo ocurre cuando la norma del gradiente crece sin control al retropropagar el error, sobre todo en redes profundas y recurrentes con pesos grandes. El entrenamiento se desestabiliza y la pérdida se vuelve NaN. El recorte de gradiente, junto con una buena inicialización y normalización, es la solución estándar.
Propagación hacia delante en una red multicapa
La propagación hacia delante es el proceso por el que una red neuronal transforma la entrada en una predicción, capa por capa. En cada capa multiplica el vector de entradas por una matriz de pesos, suma un sesgo y aplica una función de activación, de modo que la salida de una capa alimenta a la siguiente hasta el resultado final.