Volver al campus
Intermedio 28 minutos 170 XP

Gradientes y regla de la cadena

Saber en qué dirección mover cada parámetro para reducir el error.

Al terminar vas a poder

  • Interpretar una derivada como sensibilidad local
  • Leer el signo de un gradiente
  • Explicar el papel de la regla de la cadena

01

Una pendiente local

La derivada indica cuánto cambia una salida cuando movemos ligeramente una entrada. El gradiente reúne esa información para todos los parámetros de una función.

Un gradiente positivo dice que aumentar el parámetro aumenta localmente la pérdida; uno negativo dice que aumentarlo la reduce. Para minimizar nos movemos en la dirección opuesta.

02

Capas conectadas

Una red neuronal es una composición de funciones. La salida de una capa alimenta a la siguiente. La regla de la cadena permite calcular cómo un parámetro temprano termina afectando la pérdida final.

Backpropagation es una forma eficiente de aplicar esa regla desde la pérdida hacia atrás por el grafo de operaciones.

dL/dw = dL/dsalida × dsalida/dw

03

Gradiente no significa actualización

El gradiente aporta dirección y magnitud local. El optimizador decide cuánto moverse usando el learning rate y, en algoritmos como Adam, estadísticas acumuladas de pasos anteriores.

laboratorio interactivo

Encontrá el mínimo usando la pendiente

Usamos L(w) = (w − 2)². El mínimo está en w = 2, pero imaginá que el modelo no lo sabe.

El gradiente es negativo: para minimizar, aumentá w.

Pérdida
16.00
Gradiente
-8.00
gradiente = 2 × (w − 2)
práctica de comprobación+170 XP

Si el gradiente de la pérdida respecto de un peso es positivo, ¿hacia dónde lo mueve el descenso por gradiente?

Elegí una respuesta

Mis notas

Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.

Guardado automáticamente