Volver al campus
Intermedio 24 minutos 160 XP

Learning rate y descenso por gradiente

Elegir el tamaño de cada paso sin quedar inmóvil ni sobrepasar el mínimo.

Al terminar vas a poder

  • Ejecutar una actualización de descenso por gradiente
  • Reconocer aprendizaje lento e inestable
  • Explicar por qué el learning rate es un hiperparámetro

01

Convertir gradiente en movimiento

El descenso por gradiente actualiza cada parámetro restando el gradiente multiplicado por el learning rate. Ese valor no lo aprende el modelo directamente: lo elegimos como parte de la configuración.

El mismo gradiente produce pasos distintos según el learning rate.

parámetro_nuevo = parámetro_actual - learning_rate × gradiente

02

Demasiado chico o demasiado grande

Un learning rate muy pequeño puede avanzar de forma segura pero necesitar demasiados pasos. Uno demasiado grande puede atravesar el mínimo, oscilar o hacer que la pérdida explote.

No existe un valor universal. Depende de la arquitectura, el optimizador, el batch y la escala de los datos.

03

Observar antes de ajustar

Las curvas de entrenamiento permiten diagnosticar el comportamiento. Si la pérdida apenas cambia, el paso puede ser pequeño. Si oscila o se vuelve NaN, el paso puede ser excesivo o existir otro problema numérico.

laboratorio interactivo

Entrená un solo parámetro

Partimos en w = −4 y buscamos w = 2. Elegí el tamaño del paso y ejecutá actualizaciones.

Paso prudente: debería acercarse de forma estable.

Paso
0
w actual
-4.000
Pérdida actual
36.000
práctica de comprobación+160 XP

¿Qué señal sugiere con más fuerza que el learning rate es demasiado alto?

Elegí una respuesta

Mis notas

Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.

Guardado automáticamente