Logits, probabilidades y softmax
Transformar puntajes libres en una distribución interpretable.
Al terminar vas a poder
- Diferenciar logits de probabilidades
- Explicar qué normaliza softmax
- Predecir cómo cambia una distribución al mover un logit
01
Puntajes antes de decidir
La última capa de un clasificador o modelo de lenguaje suele producir logits: números reales sin obligación de ser positivos ni sumar uno. Un logit mayor expresa preferencia relativa, no una probabilidad directa.
En un modelo de lenguaje existe un logit por cada token del vocabulario.
02
Softmax convierte competencia en probabilidad
Softmax aplica una exponencial a cada logit y divide por la suma total. El resultado queda entre cero y uno y todas las probabilidades suman uno.
Como usa exponenciales, pequeñas diferencias entre logits pueden crear diferencias grandes de probabilidad. Restar el máximo antes de calcular evita problemas numéricos sin cambiar el resultado.
pᵢ = exp(zᵢ) / Σⱼ exp(zⱼ)03
Una distribución, no una certeza
Que un token tenga la probabilidad más alta no significa que sea correcto. La distribución expresa las alternativas del modelo. Durante generación podemos elegir el máximo o muestrear respetando esas probabilidades.
De logits a probabilidades
Los logits compiten. Softmax conserva el orden y hace que el total sea 100%.
Probabilidades: 100.0%
Si aumentamos solamente el logit de un token, ¿qué ocurre después de softmax?
Mis notas
Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.
Guardado automáticamente