Avanzado 25 minutos 180 XP
Attention: intuición primero
Cómo una posición decide qué información de otras posiciones necesita.
Al terminar vas a poder
- Interpretar query, key y value
- Explicar la máscara causal
- Seguir las shapes de self-attention
01
Buscar información relevante
Cada token crea una consulta (query), una clave (key) y un valor (value). La similitud entre consultas y claves produce pesos; esos pesos combinan los valores.
La atención no busca palabras en una base de datos: calcula relaciones entre representaciones dentro de la secuencia actual.
02
No mirar el futuro
En generación autoregresiva, un token solo puede atender a posiciones anteriores y a sí mismo. La máscara causal bloquea las posiciones futuras para impedir que la respuesta correcta se filtre durante el entrenamiento.
scores = (Q · Kᵀ) / √d → máscara → softmax → pesos · V práctica de comprobación+180 XP
¿Por qué un decoder autoregresivo necesita una máscara causal al entrenar?
Mis notas
Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.
Guardado automáticamente