ASCII, Unicode y UTF-8: la diferencia
ASCII es una tabla antigua con solo 128 caracteres. Unicode es un estándar mucho más amplio que asigna un número único (punto de código, ej: U+00E9) a prácticamente cualquier carácter de cualquier idioma, incluidos los emojis. UTF-8 es la forma más común de guardar esos puntos de código como bytes — los caracteres ASCII ocupan 1 byte, los acentos y símbolos especiales pueden ocupar de 2 a 4 bytes.
Para qué sirve
Útil para depurar problemas de codificación de texto, entender por qué un carácter aparece "roto" (mojibake), o verificar el tamaño real en bytes de una cadena.
Preguntas frecuentes
¿Por qué a veces una tilde se convierte en caracteres raros?
Generalmente porque el texto se guardó en UTF-8 pero se está leyendo como si fuera otra codificación, haciendo que los bytes multi-byte se interpreten mal.
¿Todo carácter ASCII también es UTF-8 válido?
Sí — los primeros 128 caracteres de UTF-8 son idénticos a ASCII, ocupando 1 byte cada uno.