Intermedio 20 minutos 140 XP
Tokens y vocabulario
Cómo convertir texto en identificadores que un modelo puede procesar.
Al terminar vas a poder
- Explicar codificación y decodificación
- Comparar tokenización por caracteres y subwords
- Construir pares entrada/objetivo
01
El modelo recibe números
Un tokenizer divide el texto en unidades y asigna un ID a cada una. El vocabulario define todas las unidades conocidas. Codificar transforma texto en IDs; decodificar hace el camino inverso.
02
Elegir la unidad
Los caracteres producen vocabularios pequeños y secuencias largas. Las palabras producen vocabularios grandes y fallan con términos nuevos. Los subwords buscan un equilibrio y son el estándar en modelos modernos.
"modelo" → ["mo", "delo"] → [417, 982] práctica de comprobación+140 XP
¿Qué ventaja tiene un tokenizer por caracteres para un primer experimento?
Mis notas
Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.
Guardado automáticamente