Verificador de similaridade de textos
Dois chamados de suporte que parecem idênticos, um post de blog que lembra o de um concorrente ou duas descrições de produto que parecem copiadas: o instinto diz que se sobrepõem, mas você quer um número. Este verificador compara dois textos e retorna duas pontuações: a sobreposição de palavras, a parcela de palavras únicas que os dois textos têm em comum, e a similaridade de caracteres, o quanto os caracteres brutos coincidem. Juntas, elas mostram se os textos compartilham vocabulário, redação ou ambos.
Como a similaridade é medida
-
1
Cole os dois textos
De qualquer tamanho, de uma frase a um artigo inteiro.
-
2
Sobreposição de palavras
Cada texto é convertido para minúsculas e dividido em palavras únicas. A pontuação de Jaccard são as palavras compartilhadas divididas pelo total de palavras distintas.
-
3
Similaridade de caracteres
A ferramenta também compara as sequências de caracteres brutas e informa a porcentagem de caracteres que coincidem.
-
4
Leia as duas pontuações
Sobreposição de palavras alta com similaridade de caracteres mais baixa indica as mesmas palavras em outra ordem. Similaridade de caracteres alta indica textos quase idênticos, letra por letra.
O que cada pontuação diz
| Pontuação | Faixa | Mede | Ponto cego |
|---|---|---|---|
| Sobreposição de palavras (Jaccard) | 0-100% | A parcela de palavras únicas comuns aos dois textos | Ignora a ordem e a frequência das palavras |
| Similaridade de caracteres | 0-100% | O quanto a sequência de caracteres bruta coincide | Sensível ao tamanho e a pequenas edições |
- Sobreposição de palavras perto de 100% significa que os dois textos usam quase o mesmo conjunto de palavras.
- Similaridade de caracteres perto de 100% significa que os textos são quase idênticos caractere por caractere.
- Uma diferença grande (sobreposição de palavras alta, similaridade de caracteres mais baixa) aponta para o mesmo vocabulário organizado de outra forma.
Exemplo resolvido
Comparando The quick brown fox com The quick red fox:
- Sobreposição de palavras: 60.00% (compartilham the, quick e fox de cinco palavras distintas)
- Similaridade de caracteres: 83.33% (só brown contra red difere)
Os dois números juntos contam a história: quase as mesmas palavras e quase os mesmos caracteres, exceto por uma palavra.
O que ela não faz
É uma comparação superficial de strings, não um detector de plágio nem de sentido:
- Compara palavras e caracteres, então dois trechos que dizem a mesma coisa com outras palavras têm pontuação baixa.
- Não tem um banco de dados de obras publicadas, então não pode dizer se um texto foi copiado de outro lugar.
- A comparação por sentido (semântica) precisa de um modelo de embeddings, que esta ferramenta não usa.
Use as pontuações como um sinal rápido de quase duplicatas, não como um veredito.
Dicas de pré-processamento
- Remova o texto padrão (assinaturas, cabeçalhos, rodapés) antes de comparar; ele infla as duas pontuações.
- Normalize os espaços e a pontuação solta para que diferenças de formatação não encubram as coincidências reais de conteúdo.
- Fique de olho nas diferenças de tamanho: tamanhos muito diferentes baixam a similaridade de caracteres mesmo quando o texto menor está contido no maior, então compare trechos comparáveis.
Perguntas frequentes
Apenas como um sinal aproximado. Ele mede a sobreposição de palavras e a similaridade de caracteres entre os dois textos que você cola; não tem um banco de dados de obras existentes e não consegue detectar cópia de uma fonte desconhecida. Uma pontuação alta sinaliza quase duplicatas que merecem um olhar mais atento, nada além disso.
Nem tanto. Se uma reescrita mantém a maioria das palavras, a sobreposição de palavras continua alta. Mas se ela troca por sinônimos, as duas pontuações caem, porque a ferramenta compara palavras e caracteres, não sentido. Pegar uma paráfrase de verdade precisa de um modelo semântico (de embeddings).
As duas pontuações lidam com textos longos, mas a comparação de similaridade de caracteres fica mais lenta conforme os textos crescem, então mantenha cada um em alguns milhares de caracteres para um resultado rápido.
Seus dois textos são enviados ao nosso servidor para serem comparados e não são armazenados. A comparação é uma simples correspondência de palavras e caracteres, sem terceiros envolvidos.
Ferramentas relacionadas
Embaralhador de palavras
Embaralhe as letras de cada palavra mantendo a primeira e a última. Ótimo para passatempos, jogos de sala de aula e desafios.
Referência de marcas de revisão
Consulte 14 convenções tradicionais da revisão em inglês, organizadas por função e explicadas com exemplos simples.
Gerador de Acrônimos
Gere acrônimos a partir de uma frase, nome de projeto ou tema. Escolha comprimento e tom, depois avalie opções pronunciáveis e fáceis de lembrar.
Gerador de nomes de fantasia
Crie nomes de personagens de fantasia em cinco estilos: elfo, anão, orc, fada ou draconato. Escolha a quantidade e depois nomes próprios, nomes completos ou nomes com títulos para campanhas de D&D, romances e listas de NPC.
Gerador de palavras aleatórias
Gere listas de palavras em inglês aleatórias. Escolha palavras do cotidiano, natureza, criativas ou tecnologia, ajuste tamanho e quantidade, e copie o resultado.
Inglês para Pig Latin
Traduza o inglês para Pig Latin e vice-versa. Aplica o movimento clássico de cluster de consoantes mais a regra do sufixo -ay.
Ferramenta disponível em outros idiomas
- Trình kiểm tra độ tương đồng văn bản [VI]
- Kontroll av textlikhet [SV]
- Textähnlichkeit prüfen [DE]
- Comprobador de similitud de textos [ES]
- เครื่องมือตรวจความคล้ายของข้อความ [TH]
- مدقق تشابه النصوص [AR]
- 텍스트 유사도 검사기 [KO]
- Vérificateur de similarité de textes [FR]
- Pemeriksa kemiripan teks [ID]
- Tekstgelijkenis controleren [NL]
- Sprawdzanie podobieństwa tekstów [PL]
- テキスト類似度チェッカー [JA]
- Text Similarity Checker [EN]
- Verifica similarità testi [IT]
- Проверка схожести текстов [RU]
- Metin benzerliği denetleyici [TR]
- 文本相似度检查器 [ZH]