Gradientes y regla de la cadena
Saber en qué dirección mover cada parámetro para reducir el error.
Al terminar vas a poder
- Interpretar una derivada como sensibilidad local
- Leer el signo de un gradiente
- Explicar el papel de la regla de la cadena
01
Una pendiente local
La derivada indica cuánto cambia una salida cuando movemos ligeramente una entrada. El gradiente reúne esa información para todos los parámetros de una función.
Un gradiente positivo dice que aumentar el parámetro aumenta localmente la pérdida; uno negativo dice que aumentarlo la reduce. Para minimizar nos movemos en la dirección opuesta.
02
Capas conectadas
Una red neuronal es una composición de funciones. La salida de una capa alimenta a la siguiente. La regla de la cadena permite calcular cómo un parámetro temprano termina afectando la pérdida final.
Backpropagation es una forma eficiente de aplicar esa regla desde la pérdida hacia atrás por el grafo de operaciones.
dL/dw = dL/dsalida × dsalida/dw03
Gradiente no significa actualización
El gradiente aporta dirección y magnitud local. El optimizador decide cuánto moverse usando el learning rate y, en algoritmos como Adam, estadísticas acumuladas de pasos anteriores.
Encontrá el mínimo usando la pendiente
Usamos L(w) = (w − 2)². El mínimo está en w = 2, pero imaginá que el modelo no lo sabe.
El gradiente es negativo: para minimizar, aumentá w.
- Pérdida
- 16.00
- Gradiente
- -8.00
Si el gradiente de la pérdida respecto de un peso es positivo, ¿hacia dónde lo mueve el descenso por gradiente?
Mis notas
Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.
Guardado automáticamente