Corretor de mojibake

Comparação de hipóteses de codificação
O texto colado e todos os resultados permanecem neste navegador. O modo em etapas mantém um registro validado nesta aba por até 30 minutos e coloca somente um identificador opaco de tarefa na URL. Nada é enviado pelo nossos servidores ou por uma API de correção.

Cole o texto que parece corrompido

Cole um texto como café ou uma sequência em japonês que tenha ficado ilegível após uma incompatibilidade de codificação. O original permanece inalterado no editor.

Máximo de 50.000 caracteres. Esta ferramenta compara somente texto Unicode colado; ela não inspeciona nem corrige arquivos, fluxos de bytes, bancos de dados ou cabeçalhos HTTP.

Mojibake é o nome dado a informações legíveis que aparecem com caracteres errados porque seus bytes foram decodificados com um conjunto de caracteres incompatível. Um exemplo comum é café: café foi codificado em UTF-8, mas seus bytes foram interpretados como Latin-1 ou Windows-1252. Cole o texto visível para comparar hipóteses de correção rigorosamente reversíveis. A ferramenta mantém o original inalterado, identifica cada resultado como hipótese e faz a comparação localmente no navegador.

Como comparar uma hipótese de correção de mojibake

  1. 1

    Cole o texto visível

    Use o texto exatamente como você o recebeu. A ferramenta não envia nem inspeciona um arquivo de origem.

  2. 2

    Autorize a comparação

    Peça ao navegador que teste interpretações de bytes Latin-1 e Windows-1252 com um decodificador UTF-8 rigoroso.

  3. 3

    Compare sem presumir

    Leia o original inalterado ao lado de cada resultado reversível e escolha somente quando o contexto confirmar.

  4. 4

    Copie o texto simples

    Copie, baixe ou imprima uma hipótese selecionada sem substituir o original.

O que uma correção de mojibake pode determinar e o que não pode

Uma codificação associa caracteres a bytes e permite fazer o caminho de volta. O UTF-8 representa é com os dois bytes C3 A9. Se um programa decodificar esses bytes como Windows-1252 ou ISO-8859-1, o resultado visível poderá ser é. Uma hipótese útil de correção inverte justamente esse erro: trata os caracteres antigos visíveis como valores de bytes, decodifica esses bytes rigorosamente como UTF-8 e verifica se codificar novamente o resultado em UTF-8 produz exatamente os mesmos bytes.

Essa verificação de ida e volta descarta sequências UTF-8 incompletas ou malformadas. Ela também rejeita qualquer resultado que contenha o caractere de substituição , pois a informação que esse caractere representa já foi perdida. Uma conversão de ida e volta válida é um indício a favor de uma hipótese, mas não comprova qual codificação o sistema de origem usou nem o que o autor pretendia escrever.

Texto visível Hipótese testada Resultado possível O que verificar
café Bytes UTF-8 lidos como Latin-1 café Comparar a grafia com a fonte
It’s Bytes UTF-8 lidos como Windows-1252 It’s Conferir a pontuação e o estilo editorial
文字化け Bytes UTF-8 lidos como Latin-1 文字化け Comparar o japonês com uma cópia confiável
café Dois erros de codificação consecutivos café Examinar as duas etapas controladas

Por que o texto em japonês precisa de contexto

O termo japonês 文字化け é usado para descrever caracteres que aparecem corrompidos ou ilegíveis. Um texto japonês em UTF-8 pode virar uma sequência longa de letras latinas, símbolos e caracteres semelhantes a controles quando seus bytes são decodificados com um mapeamento antigo incorreto. A reversibilidade ajuda na avaliação, mas um nome curto ou um caractere isolado ainda pode ser ambíguo. Compare o resultado com o documento original, uma exportação do banco de dados, o remetente ou outra cópia confiável.

Limites e recuperação mais segura

Esta ferramenta recebe texto Unicode que o navegador já decodificou. Ela não recupera bytes descartados anteriormente, não deduz a codificação de um arquivo binário, não corrige uma coluna de banco de dados nem altera um cabeçalho HTTP Content-Type. Se nenhum resultado aparecer, mantenha o original. Sempre que possível, obtenha os bytes reais de origem, faça um backup, identifique a codificação declarada e a codificação efetiva e decodifique apenas uma vez com uma ferramenta própria para arquivos ou fluxos de bytes. Nunca salve repetidamente o texto corrompido sobre a única cópia da fonte.

Perguntas frequentes

Não. Significa que uma interpretação específica de bytes antigos foi decodificada como UTF-8 válido e passou por uma verificação exata de ida e volta. Mais de uma interpretação pode produzir o mesmo texto legível ou textos diferentes. O contexto e uma fonte confiável continuam sendo necessários.

Talvez os caracteres visíveis não representem bytes UTF-8 lidos como ISO-8859-1 ou Windows-1252, a sequência pode estar incompleta ou um caractere de substituição pode já ter removido informações. Mantenha o original e examine os bytes reais e os metadados de codificação.

Não. Ele compara somente texto Unicode colado. Não lê arquivos, não detecta a codificação de um arquivo, não se conecta a bancos de dados, não reescreve valores armazenados nem corrige cabeçalhos do servidor. Faça backup da fonte antes de usar um processo de conversão que trabalhe com bytes.

Não. A comparação, a seleção, a cópia, a criação do TXT e a preparação para impressão acontecem no navegador. O modo em etapas pode manter um registro validado nesta aba por até 30 minutos e coloca somente um identificador opaco de tarefa na URL.

Ferramentas relacionadas