Conversor de HTML para Texto
Emails em texto simples, análises de texto e pipelines de contagem de palavras precisam que o HTML seja transformado na string legível que um humano veria, sem artefatos de marcação. Cole o HTML e esta ferramenta remove cada tag, decodifica entidades (& → &), colapsa sequências de espaços criadas por indentação e produz um bloco limpo de prosa legível pronto para análise ou para a parte text/plain de um email multipart.
Como remover HTML para texto
-
1
Cole o HTML
Qualquer tamanho, um trecho, um corpo de email rico ou uma página inteira.
-
2
Converter
Um clique: cada tag e atributo é removido e as entidades são decodificadas.
-
3
Revise as quebras de linha
Parágrafos, itens de lista e linhas de tabela se tornam linhas separadas, então o texto mantém sua estrutura.
-
4
Copie o texto
A saída é texto Unicode simples, seguro para ser usado em um contador de palavras, um modelo de email ou um modelo de sentimento.
Como a conversão lida com tags complicadas
Transformar HTML em texto é mais do que string.replace(/<[^>]+>/, ""): uma expressão regular ingênua deixa os códigos de entidades e os espaços de indentação no lugar, e não sabe que </p> deveria iniciar uma nova linha.
Tags em nível de bloco vs inline
Tags em nível de bloco (<br>, e as tags de fechamento </p>, </div>, </h1> a </h6>, </li>, </tr>) produzem uma quebra de linha cada uma. Tags inline (<a>, <span>, <strong>) não deixam espaços em branco, então as palavras não se fundem.
Comportamentos específicos de tags
| Tag | Tratamento |
|---|---|
<br> |
Uma quebra de linha |
</p>, </div>, </h1> a </h6> |
Uma quebra de linha por tag de fechamento |
</li>, </tr> |
Uma quebra de linha; marcadores e separadores de células não são adicionados |
<a href="url">texto</a> |
texto; o atributo href é removido |
<img alt="texto"> |
Nada, a tag não tem texto visível |
<script>, <style> |
As tags são removidas, o texto entre elas é mantido |
Decodificação de entidades
- Entidades nomeadas (
&,©,é) decodificam para seu caractere Unicode. - Entidades numéricas (
©,©) também são decodificadas. - Entidades desconhecidas são preservadas literalmente, para que ferramentas de análise as vejam.
Normalização de espaços em branco
- Espaços e tabulações antes de uma quebra de linha são removidos.
- Três ou mais linhas em branco seguidas são reduzidas a uma única.
- Os espaços entre palavras são mantidos como estão; o conversor não reajusta o texto.
Usos
- Gerar a parte
text/plainde um email multipart. - Limpar artigos extraídos antes de passar para um modelo de linguagem.
- Alimentar um índice de busca em texto simples.
- Calcular uma contagem honesta de palavras que ignora a marcação.
Perguntas frequentes
A formatação visual (negrito, cor, fonte) é perdida, esse é o objetivo. A estrutura sobrevive como quebras de linha: parágrafos, itens de lista e linhas de tabela se tornam linhas separadas, então o texto permanece legível.
O texto visível do link permanece, mas a URL é removida junto com os atributos da tag. Se você precisa das URLs, use um conversor dedicado de HTML para Markdown.
O conversor remove as tags, mas mantém o texto entre elas, então o conteúdo dos blocos <script> e <style> permanece na saída. Remova-o do HTML de origem antes, se não o quiser.
Sim. A saída é UTF-8 e preserva todos os caracteres não-ASCII da entrada. Entidades como © e é são decodificadas em seus equivalentes Unicode.
Ferramentas relacionadas
Referência da Tabela ASCII
Tabela ASCII completa de 0 a 127 com valores decimais, hexadecimais, octais e binários e notação de referência numérica HTML, incluindo NUL, LF e DEL.
Referência de Caracteres HTML
Lista pesquisável de entidades HTML, seus códigos nomeados e numéricos, e uma cópia com um clique para caracteres e símbolos especiais.
Referência de atalhos de teclado
Pesquise atalhos padrão documentados do VS Code, Chrome e Bash com GNU Readline no macOS, Windows e Linux.
Gerador de EditorConfig
Gere um arquivo .editorconfig com suas regras de estilo e tamanho de indentação, fim de linha, charset e espaços em branco para formatação consistente entre IDEs e editores.
Validador de Email
Valide um endereço de email: verificação de sintaxe RFC 5322, consulta de registro MX em tempo real, além de detalhes de parte local, domínio e comprimento. Nenhum email é enviado.
Formatador de HTML
Formate HTML localmente no navegador com indentação de dois ou quatro espaços. O HTML não é enviado nem validado.
Ferramenta disponível em outros idiomas
- Convertisseur HTML en texte [FR]
- مُحوّل HTML إلى نص [AR]
- HTML zu Text Konverter [DE]
- HTML till textomvandlare [SV]
- เครื่องแปลง HTML เป็นข้อความ [TH]
- Convertidor de HTML a Texto [ES]
- HTML에서 텍스트로 변환기 [KO]
- Konverter HTML ke Teks [ID]
- HTMLからテキストへの変換ツール [JA]
- HTML naar tekst converter [NL]
- Chuyển đổi HTML thành Văn bản [VI]
- Konwerter HTML do tekstu [PL]
- HTML to Text Converter [EN]
- Convertitore da HTML a Testo [IT]
- Преобразователь HTML в текст [RU]
- HTML'den Metne Dönüştürücü [TR]
- HTML到文本转换器 [ZH]