Conversor de codificação de arquivos de texto

Quando um texto mostra café como café ou naïve como naïve, os caracteres estão certos: é a codificação que está sendo lida do jeito errado. Cole o texto, informe ao conversor com qual codificação ele deve ler e para qual deve gravar, e ele recodifica de forma limpa entre UTF-8, UTF-16, ISO-8859-1 (Latin-1), Windows-1252 e outras páginas de código comuns. Copie o resultado corrigido direto para o seu editor, planilha ou banco de dados.

Como converter a codificação de um texto

  1. 1

    Cole seu texto

    Qualquer texto que pareça corrompido ou que você precise recodificar para outro programa.

  2. 2

    Confira a detecção

    Uma dica aproximada mostra a codificação provável acima do campo.

  3. 3

    Escolha a codificação de origem

    Defina «De» conforme os bytes devem ser lidos: UTF-8, Windows-1252, ISO-8859-1, SJIS e outras.

  4. 4

    Escolha a codificação de destino

    UTF-8 é o padrão moderno; UTF-16, Big5 ou GB2312 estão disponíveis quando um programa específico precisa deles.

  5. 5

    Converta e copie

    O texto é recodificado e um clique copia o resultado para a área de transferência.

De onde vêm os conflitos de codificação

Origem Codificação provável
Excel «Salvar como CSV» no Windows Windows-1252
Aplicativo antigo do Windows Windows-1252
Utilitário Unix antigo ISO-8859-1 (Latin-1)
Editor moderno de macOS/Linux UTF-8
Texto japonês no Windows Shift-JIS (SJIS)
Chinês simplificado no Windows GB2312
Chinês tradicional (Taiwan/Hong Kong) Big5

Os sintomas clássicos

  • café aparece como café quando os bytes UTF-8 são lidos como Latin-1. Defina «De» como UTF-8 para reinterpretar os bytes.
  • ñ vira ñ pelo mesmo motivo.
  • Um mojibake duplo como café significa que o texto foi salvo de novo após a primeira leitura errada, codificando a interpretação incorreta uma segunda vez.
  • Um  no início é uma marca de ordem de bytes UTF-8 lida como três caracteres Latin-1.

Assim que você reconhece o sintoma, o caminho costuma ficar claro: leia o texto como o que ele realmente é (Latin-1, Windows-1252 ou o que se aplicar) e grave-o de volta como UTF-8.

Marcas de ordem de bytes (BOM)

Este conversor não adiciona nem remove uma marca de ordem de bytes por opção: o comportamento segue a codificação de destino. A saída UTF-8 não tem BOM. A saída UTF-16 simples começa com um BOM e é big-endian, enquanto UTF-16BE e UTF-16LE gravam os bytes sem BOM. Escolha UTF-8, a menos que um programa específico peça UTF-16.

Quando um caractere não tem correspondência

Alguns bytes não têm significado na codificação de origem escolhida, e alguns caracteres não podem ser representados na de destino. Nesse caso, a conversão substitui por um marcador em vez de parar. O que mais importa é acertar a codificação de origem: uma cadeia só com ASCII é válida em qualquer codificação, então um conflito costuma aparecer apenas quando há caracteres acentuados ou não latinos.

Perguntas frequentes

As listas «De» e «Para» oferecem UTF-8, UTF-16, UTF-16BE, UTF-16LE, ISO-8859-1, ISO-8859-15, Windows-1252, ASCII, EUC-JP, SJIS (Shift-JIS), GB2312 e Big5. Você pode converter de qualquer uma para qualquer outra.

Para a web, bancos de dados e quase qualquer fluxo moderno, sim. As exceções são aplicativos antigos do Windows que só leem Windows-1252, algumas ferramentas antigas de mainframe e certos softwares japoneses que esperam Shift-JIS.

É um palpite baseado no padrão de bytes, escolhido entre UTF-8, UTF-16, ISO-8859-1, Windows-1252 e ASCII. Pode errar com textos curtos ou só com ASCII, então trate-a como uma dica e defina você mesmo a codificação «De» quando souber.

O texto é enviado ao nosso servidor para realizar a conversão e não é armazenado depois que a resposta é retornada. Para material confidencial, prefira um editor offline com conversor de codificação integrado.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas