La tangente hiperbólica (tanh) es una función de activación que comprime cualquier valor real en el intervalo (-1, 1) con salida centrada en cero, lo que reduce el sesgo sistemático de los gradientes frente a la sigmoide. Es la activación estándar en las celdas de memoria LSTM y GRU de las redes recurrentes.
La función sigmoide convierte cualquier número real en un valor entre 0 y 1, lo que la vuelve la función de activación natural para expresar probabilidades en una red neuronal. Es diferenciable en todo su dominio, aunque sufre saturación y desvanecimiento del gradiente en redes profundas, por lo que hoy se reserva casi siempre a la capa de salida.
La función Softmax transforma los logits de salida de una red neuronal en una distribución de probabilidad que suma 1. Es la activación estándar en clasificación multiclase, desde clasificadores de imágenes hasta el vocabulario de los modelos de lenguaje como GPT.
La función lineal f(x) = ax + b es la activación más simple de una red neuronal: en su forma identidad, f(x) = x, es el estándar en la capa de salida para regresión porque no acota el rango de valores posibles. En capas ocultas falla, porque componer varias funciones lineales colapsa toda la red en una única capa lineal equivalente.
La red neuronal totalmente conectada, también llamada red densa, es la arquitectura fundamental del aprendizaje profundo: cada neurona de una capa se conecta con todas las neuronas de la capa anterior y de la siguiente. Esta conectividad total le permite aproximar cualquier función continua, aunque su coste computacional crece de forma cuadrática con el número de neuronas.
En una red neuronal, la entrada se representa como un vector columna x en R^n que la capa oculta transforma mediante una matriz de pesos W, un vector de sesgos b y una función de activación no lineal como ReLU, sigmoide o tanh. El entrenamiento ajusta W y b minimizando la función de pérdida con descenso por gradiente y retropropagación.
Una red neuronal multicapa está formada por una capa de entrada, una o más capas ocultas y una capa de salida, donde cada neurona pondera sus entradas y aplica una función de activación no lineal antes de pasar el resultado a la siguiente capa. Mediante forward propagation y backpropagation, la red ajusta millones de pesos hasta aprender representaciones jerárquicas capaces de clasificar imágenes, traducir texto o generar lenguaje.
Las redes neuronales profundas son hoy la base de casi toda aplicación de inteligencia artificial: desde el reconocimiento facial hasta la traducción automática. Con arquitecturas como CNN, RNN y Transformers, el deep learning ha transformado la visión computarizada, el reconocimiento de voz y el procesamiento del lenguaje natural durante la última década.
La inteligencia artificial moderna se apoya en tres pilares: aprendizaje automático, redes neuronales profundas y procesamiento del lenguaje natural. Estas técnicas han llevado el reconocimiento de imágenes y la traducción automática a superar la precisión humana en tareas concretas, aunque el sistema completo sigue dependiendo de datos de calidad y supervisión humana constante.
5 min2434,3
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).