Learning rate y descenso por gradiente
Elegir el tamaño de cada paso sin quedar inmóvil ni sobrepasar el mínimo.
Al terminar vas a poder
- Ejecutar una actualización de descenso por gradiente
- Reconocer aprendizaje lento e inestable
- Explicar por qué el learning rate es un hiperparámetro
01
Convertir gradiente en movimiento
El descenso por gradiente actualiza cada parámetro restando el gradiente multiplicado por el learning rate. Ese valor no lo aprende el modelo directamente: lo elegimos como parte de la configuración.
El mismo gradiente produce pasos distintos según el learning rate.
parámetro_nuevo = parámetro_actual - learning_rate × gradiente02
Demasiado chico o demasiado grande
Un learning rate muy pequeño puede avanzar de forma segura pero necesitar demasiados pasos. Uno demasiado grande puede atravesar el mínimo, oscilar o hacer que la pérdida explote.
No existe un valor universal. Depende de la arquitectura, el optimizador, el batch y la escala de los datos.
03
Observar antes de ajustar
Las curvas de entrenamiento permiten diagnosticar el comportamiento. Si la pérdida apenas cambia, el paso puede ser pequeño. Si oscila o se vuelve NaN, el paso puede ser excesivo o existir otro problema numérico.
Entrená un solo parámetro
Partimos en w = −4 y buscamos w = 2. Elegí el tamaño del paso y ejecutá actualizaciones.
Paso prudente: debería acercarse de forma estable.
- Paso
- 0
- w actual
- -4.000
- Pérdida actual
- 36.000
¿Qué señal sugiere con más fuerza que el learning rate es demasiado alto?
Mis notas
Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.
Guardado automáticamente