Volver al campus
Intermedio 20 minutos 140 XP

Tokens y vocabulario

Cómo convertir texto en identificadores que un modelo puede procesar.

Al terminar vas a poder

  • Explicar codificación y decodificación
  • Comparar tokenización por caracteres y subwords
  • Construir pares entrada/objetivo

01

El modelo recibe números

Un tokenizer divide el texto en unidades y asigna un ID a cada una. El vocabulario define todas las unidades conocidas. Codificar transforma texto en IDs; decodificar hace el camino inverso.

02

Elegir la unidad

Los caracteres producen vocabularios pequeños y secuencias largas. Las palabras producen vocabularios grandes y fallan con términos nuevos. Los subwords buscan un equilibrio y son el estándar en modelos modernos.

"modelo" → ["mo", "delo"] → [417, 982]
práctica de comprobación+140 XP

¿Qué ventaja tiene un tokenizer por caracteres para un primer experimento?

Elegí una respuesta

Mis notas

Se guardan solo en tu navegador y se incluyen en el token o respaldo cifrado.

Guardado automáticamente