Detector de Codificación de Texto
Detecta la codificación de un archivo de texto (UTF-8, UTF-16 o Latin-1/Windows-1252) a partir de su marca de orden de bytes (BOM) y la validez de sus bytes, o repara texto que se ve mal codificado (mojibake), como "é" en vez de "é". Todo se procesa en tu navegador.
Cómo funciona
- Pestaña 'Detectar codificación de un archivo': selecciona un archivo de texto y la herramienta busca primero una marca de orden de bytes (BOM) al inicio.
- Si no hay BOM, intenta decodificar los bytes como UTF-8 estricto; si falla, indica que probablemente se trata de una codificación de un solo byte como Windows-1252 o ISO-8859-1.
- Pestaña 'Arreglar texto mal codificado': pega un texto con caracteres extraños (mojibake) y la herramienta reconstruye los bytes originales asumiendo que fueron decodificados como Latin-1 por error, y los vuelve a decodificar como UTF-8.
- Si la reinterpretación produce texto legible, se muestra como resultado corregido junto con un botón para copiarlo.
Casos de uso
- Averiguar por qué un archivo .csv o .txt muestra símbolos raros al abrirlo en cierto programa.
- Reparar texto copiado de una base de datos o API que muestra acentos como secuencias extrañas ("á", "é", "ñ").
- Confirmar si un archivo tiene BOM antes de procesarlo con una herramienta que no lo maneja bien.
- Verificar la codificación de un archivo exportado desde un sistema antiguo antes de importarlo a uno nuevo.
Casos de uso
- Averiguar por qué un archivo .csv o .txt muestra símbolos raros al abrirlo en cierto programa.
- Reparar texto copiado de una base de datos o API que muestra acentos como secuencias extrañas ("á", "é", "ñ").
- Confirmar si un archivo tiene BOM antes de procesarlo con una herramienta que no lo maneja bien.
- Verificar la codificación de un archivo exportado desde un sistema antiguo antes de importarlo a uno nuevo.
Errores comunes
- Esperar que la herramienta identifique con certeza absoluta cualquier codificación posible.Sin una marca BOM, la detección es heurística: se basa en si los bytes son válidos como UTF-8 o no. Un archivo en otra codificación puede, por coincidencia, también ser UTF-8 válido, así que la confianza mostrada (alta, media o baja) es una guía, no una certeza absoluta.
- Pegar un texto con emojis o símbolos de otros alfabetos en la pestaña de mojibake y esperar que se corrija.La reparación de mojibake asume que cada carácter representa un byte (0-255), como ocurre cuando UTF-8 se decodificó por error como Latin-1. Si el texto ya contiene caracteres fuera de ese rango (emojis, por ejemplo), no encaja con ese patrón y la herramienta lo indica en vez de dañar el texto.
- Pegar texto que ya está correctamente codificado y sorprenderse de que 'no cambió nada'.Si el texto ya es correcto, reinterpretarlo como UTF-8 mal decodificado no produce una versión distinta (o produce texto sin sentido), y la herramienta lo señala en vez de alterar un texto que no tenía el problema.
Preguntas frecuentes
Es el nombre que recibe el texto ilegible que aparece cuando un archivo se decodifica con una codificación distinta a la que realmente tiene. El caso más común en la web es texto UTF-8 (que usa varios bytes por cada carácter con tilde o eñe) interpretado incorrectamente como Latin-1/Windows-1252 (que asume un byte por carácter), lo que convierte 'é' en 'é'.
Solo repara el caso específico —y más común— de UTF-8 decodificado por error como Latin-1/Windows-1252. Otras combinaciones de codificaciones incorrectas (por ejemplo, Shift-JIS interpretado como UTF-8) requieren una lógica distinta que esta herramienta no cubre.
El BOM (byte order mark) es una secuencia de bytes invisible al inicio de un archivo que declara explícitamente su codificación (UTF-8, UTF-16 LE o UTF-16 BE). Cuando existe, la detección es prácticamente segura; cuando no existe, hay que recurrir a heurísticas basadas en la validez de los bytes.
No. Tanto la lectura del archivo como el análisis de bytes y la reparación de mojibake ocurren completamente en tu navegador. Nada se envía ni se almacena en un servidor externo.
Alternativas
En la terminal, comandos como `file -i` (Linux/Mac) o herramientas como Notepad++ (Windows) también detectan o permiten forzar la codificación de un archivo. Para el caso específico del mojibake por UTF-8 mal decodificado como Latin-1, esta herramienta hace la corrección con un clic, sin instalar nada y sin subir tu archivo o texto a ningún servidor.