Volver al campus
Intermedio 22 minutos 140 XP

Logits, probabilidades y softmax

Transformar puntajes libres en una distribución interpretable.

Al terminar vas a poder

  • Diferenciar logits de probabilidades
  • Explicar qué normaliza softmax
  • Predecir cómo cambia una distribución al mover un logit

01

Puntajes antes de decidir

La última capa de un clasificador o modelo de lenguaje suele producir logits: números reales sin obligación de ser positivos ni sumar uno. Un logit mayor expresa preferencia relativa, no una probabilidad directa.

En un modelo de lenguaje existe un logit por cada token del vocabulario.

02

Softmax convierte competencia en probabilidad

Softmax aplica una exponencial a cada logit y divide por la suma total. El resultado queda entre cero y uno y todas las probabilidades suman uno.

Como usa exponenciales, pequeñas diferencias entre logits pueden crear diferencias grandes de probabilidad. Restar el máximo antes de calcular evita problemas numéricos sin cambiar el resultado.

pᵢ = exp(zᵢ) / Σⱼ exp(zⱼ)

03

Una distribución, no una certeza

Que un token tenga la probabilidad más alta no significa que sea correcto. La distribución expresa las alternativas del modelo. Durante generación podemos elegir el máximo o muestrear respetando esas probabilidades.

laboratorio interactivo

De logits a probabilidades

Los logits compiten. Softmax conserva el orden y hace que el total sea 100%.

Probabilidades: 100.0%

gato0%
perro0%
casa0%
práctica de comprobación+140 XP

Si aumentamos solamente el logit de un token, ¿qué ocurre después de softmax?

Elegí una respuesta

Mis notas

Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.

Guardado automáticamente