Ir para o conteúdo
Totalmente local

Inspetor de caracteres Unicode

Divida o texto em caracteres individuais e veja o ponto de código, nome, bloco, categoria e tamanho de cada um.

Entrada

Inspetor de caracteres Unicode

Cole qualquer texto e esta ferramenta divide-o em caracteres individuais, exibindo para cada um o seu ponto de código (U+XXXX), um nome legível, o seu bloco Unicode, a sua categoria geral (letra, marca, pontuação, símbolo, separador ou controlo), uma direção de texto aproximada e quantos bytes ocupa em UTF-8. A ferramenta foi concebida para esses momentos em que o texto parece correto mas se comporta de forma estranha — uma aspas curva que quebra um analisador JSON, um espaço de largura zero copiado de uma página web, um homógrafo escondido num nome de domínio, ou um emoji que na verdade é composto por vários pontos de código juntos.

Ative «agrupar caracteres idênticos» para unificar repetições numa única linha por carácter distinto com contagem de ocorrências, que é a forma mais rápida de responder «que caracteres aparecem neste ficheiro e com que frequência?». «Apenas caracteres não-ASCII» oculta A-Z, dígitos e pontuação básica, para que um documento longo mostre apenas os caracteres que merecem atenção. «Descompor emoji compostos» divide sequências construídas a partir de vários pontos de código — bandeiras, emoji familiares, variantes com tons de pele — nos seus componentes brutos, em vez de listar toda a sequência como uma linha. Escolha uma tabela simples para ler no ecrã, ou CSV para colar numa folha de cálculo.

Os nomes dos caracteres provêm de uma grande tabela incorporada que cobre ASCII, letras latinas acentuadas (construídas seguindo a mesma regra letra-base-mais-diacrítico que o Unicode usa), cirílico, grego, símbolos comuns, ideogramas CJK e sílabas Hangul — não é uma cópia da base de dados completa com ~150.000 nomes Unicode, que seria demasiado grande para enviar para um separador de navegador. Os pontos de código raros ou não atribuídos recorrem a uma descrição baseada no bloco em vez de uma suposição, e a FAQ abaixo indica exatamente onde se encontra a linha.

Tudo é executado localmente no seu navegador: o texto que inspeciona, incluindo palavras-passe, notas privadas ou qualquer outra coisa que não colaria num formulário web aleatório, nunca é carregado. Copie o resultado, descarregue como ficheiro .txt ou envie diretamente para outra ferramenta.

FAQ

Por que um emoji às vezes aparece como várias linhas?
Emoji como bandeiras, grupos familiares ou variantes com tons de pele são frequentemente construídos a partir de vários pontos de código Unicode unidos. Por padrão, a ferramenta mostra-os como um único carácter; ative «descompor emoji compostos» para ver os pontos de código individuais que os compõem.
O que significa "bloco" aqui?
Um bloco Unicode é um intervalo designado de pontos de código, como "Latin Básico" ou "Cirílico". Agrupa caracteres conforme a sua localização no padrão Unicode, que é diferente da sua categoria geral (letra, pontuação, símbolo e assim por diante).
Os nomes dos caracteres são sempre o nome Unicode oficial?
Para ASCII, letras latinas comuns com acentos, cirílico, grego, ideogramas CJK, sílabas Hangul e um conjunto amplo de símbolos e emoji comuns, sim. Para pontos de código mais raros, a ferramenta mostra um fallback descritivo baseado no bloco em vez de adivinhar um nome exato — a base de dados completa de nomes oficiais tem cerca de 150.000 entradas e não cabe numa página enviada para o seu navegador.
Como é determinada a direção do texto?
É uma verificação simplificada, não o algoritmo bidirecional Unicode completo: as letras de escritas da direita para esquerda (árabe, hebraico e similares) são marcadas como "rtl", outras letras e dígitos são marcados como "ltr", e a pontuação, símbolos e espaçamento são marcados como "neutral".
O meu texto é carregado em algum lugar?
Não. Cada carácter é inspecionado completamente no seu navegador — nada do que cola aqui é enviado para um servidor.