Categorías

Ruta de aprendizaje Avanzado

Entrenamiento: descenso de gradiente y retropropagación

El motor de aprendizaje: descenso de gradiente, tasa de aprendizaje, SGD y mini-batch, la retropropagación paso a paso, el grafo computacional, los jacobianos de una capa y la superficie de pérdida.

  • 8 recursos
  • 1 visitas
  • ~62 min

Esta ruta explica cómo aprenden de verdad las redes neuronales: el descenso de gradiente y el algoritmo que lo hace posible a gran escala, la retropropagación, desarrollados con las matemáticas completas paso a paso. Está pensada para quien ya conoce el paso hacia adelante de una red (capas, pesos, funciones de activación) y quiere entender el mecanismo de aprendizaje en profundidad.

Al terminar sabrás derivar a mano el gradiente de una capa densa, distinguir entre descenso de gradiente por lotes, estocástico y mini-batch según el caso de uso, y razonar sobre por qué una red converge, se estanca en un mínimo local o queda atrapada en un punto de silla. Es contenido de nivel avanzado: da por hecho soltura con derivadas parciales, notación matricial y la arquitectura básica de una red feedforward.

El recorrido arranca con la intuición del descenso de gradiente y el papel de la tasa de aprendizaje, y sigue comparando las variantes por lotes, estocástica y mini-batch que se usan en la práctica. A partir de ahí entra en retropropagación: primero la intuición de por qué funciona, después su derivación matemática completa, y el grafo computacional que la implementa mediante diferenciación automática. Cierra con los gradientes y jacobianos de una capa densa y un análisis de la superficie de pérdida, mínimos locales incluidos, para entender por qué el entrenamiento se comporta como lo hace. Una capa densa de apenas 100 neuronas ya genera miles de parámetros cuyo gradiente hay que recalcular en cada paso; la retropropagación resuelve eso en una sola pasada hacia atrás gracias a la regla de la cadena.

Inteligencia Artificial

El descenso de gradiente (gradient descent)

El descenso de gradiente es el algoritmo que entrena casi todas las redes neuronales. Calcula la pendiente de la función de pérdida respecto a cada peso y da un paso pequeño en la dirección contraria, controlado por la tasa de aprendizaje, hasta acercarse a un mínimo donde el error deja de bajar.

Inteligencia Artificial

Descenso de gradiente por lotes, estocástico y mini-batch

El descenso de gradiente por lotes usa todos los datos en cada paso, el estocástico usa una sola muestra y el mini-batch escoge un grupo intermedio, casi siempre de 32 a 256 ejemplos. Esta guía compara las tres variantes, su coste, su ruido y por qué el mini-batch se ha convertido en el estándar del entrenamiento.

Inteligencia Artificial

Retropropagación, la intuición detrás del aprendizaje

La retropropagación reparte la culpa del error entre todos los pesos de una red neuronal. Propaga hacia atrás una señal de error capa por capa, multiplicando por las derivadas locales, y así obtiene el gradiente de cada peso en una sola pasada. Esa idea, publicada en 1986, es la que hace posible entrenar redes profundas.

Inteligencia Artificial

El grafo computacional y la diferenciación automática

Un grafo computacional representa una función como una red de operaciones elementales. La diferenciación automática recorre ese grafo para calcular derivadas exactas: el modo inverso, base de la retropropagación, obtiene el gradiente de todos los pesos en una sola pasada hacia atrás. Es el mecanismo que hace posible entrenar redes con miles de millones de parámetros.

Inteligencia Artificial

Gradientes de una capa densa, matrices y jacobianos

En una capa densa con z igual a Wx más b, la matriz jacobiana de la salida respecto a la entrada es la propia matriz de pesos W. De ahí salen las dos reglas del entrenamiento: el gradiente respecto a los pesos vale delta por x transpuesta, y el gradiente respecto a la entrada vale W transpuesta por delta.

Inteligencia Artificial

Mínimos locales, puntos de silla y la superficie de pérdida

En redes neuronales grandes la superficie de pérdida casi nunca atrapa al entrenamiento en un mínimo local malo. El obstáculo real son los puntos de silla, mucho más abundantes en alta dimensión. Este artículo explica mínimos locales frente a globales, por qué el descenso de gradiente estocástico los esquiva y qué papel juega la convexidad.