Volver al campus
Avanzado 25 minutos 180 XP

Attention: intuición primero

Cómo una posición decide qué información de otras posiciones necesita.

Al terminar vas a poder

  • Interpretar query, key y value
  • Explicar la máscara causal
  • Seguir las shapes de self-attention

01

Buscar información relevante

Cada token crea una consulta (query), una clave (key) y un valor (value). La similitud entre consultas y claves produce pesos; esos pesos combinan los valores.

La atención no busca palabras en una base de datos: calcula relaciones entre representaciones dentro de la secuencia actual.

02

No mirar el futuro

En generación autoregresiva, un token solo puede atender a posiciones anteriores y a sí mismo. La máscara causal bloquea las posiciones futuras para impedir que la respuesta correcta se filtre durante el entrenamiento.

scores = (Q · Kᵀ) / √d → máscara → softmax → pesos · V
práctica de comprobación+180 XP

¿Por qué un decoder autoregresivo necesita una máscara causal al entrenar?

Elegí una respuesta

Mis notas

Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.

Guardado automáticamente