La inicialización de pesos fija la escala de los valores iniciales de la matriz W antes de entrenar. Xavier/Glorot, de 2010, reparte la varianza entre entradas y salidas y sirve para sigmoide y tanh; He, de 2015, la duplica para ReLU, que anula la mitad de las activaciones. Elegir mal frena o rompe el aprendizaje.
Elegir una función de activación es sencillo con una regla base: usa ReLU en las capas ocultas, GELU o SiLU en transformers y reserva la salida para softmax en clasificación multiclase, sigmoide en problemas binarios y una activación lineal en regresión. Esta comparativa reúne fórmulas, rangos y casos de uso.
Leaky ReLU es una función de activación derivada de ReLU que sustituye el valor cero de las entradas negativas por una pendiente pequeña, normalmente 0.01. Así el gradiente nunca es exactamente cero, lo que evita el problema de la neurona muerta y estabiliza el entrenamiento en redes convolucionales, recurrentes y GAN muy profundas.
ReLU (Unidad Lineal Rectificada, f(x) = max(0, x)) es la función de activación dominante en el aprendizaje profundo desde que AlexNet la popularizó en 2012: barata de calcular, resistente al desvanecimiento del gradiente y con una debilidad conocida, el dying ReLU.
5 min432
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).