Como contar palavras e caracteres online (e por que os números são diferentes)
Cole o mesmo texto no Microsoft Word, Twitter, Google Docs e em um contador do navegador e você verá quatro contagens de caracteres diferentes. Não é um bug – é porque cada aplicativo conta algo um pouco diferente e todos estão tecnicamente corretos. Compreender a diferença é importante quando você está escrevendo o título de um artigo, um tweet ou uma cópia de SEO com limite de caracteres.
Palavras vs caracteres vs caracteres sem espaços
O contador de palavras distingue entre três medições simples. Palavras são sequências de letras, números e apóstrofos separados por espaços em branco ou pontuação. Personagens conte cada caractere, incluindo espaços, pontuação e emoji. Personagens sem espaços elimine o espaço em branco, mas mantenha todo o resto. Para um tweet com limite de caracteres, esta distinção é importante: o limite é aplicado ao que os navegadores contam, que é a contagem completa de caracteres, incluindo espaços.
Por que Word, Twitter e navegadores discordam
A discordância acontece devido à forma como diferentes sistemas representam o texto. A maior parte do texto em inglês é simples – um caractere no editor equivale a uma unidade para contar. Mas os emojis, combinando diacríticos e escritas não latinas, quebram essa suposição. Um emoji como 👨👩👧 (família) pode ser renderizado como um único glifo, mas é codificado como vários pontos de código (as unidades Unicode internas). O Microsoft Word pode contá-lo como um caractere, o Twitter como três e uma ferramenta compatível com Unicode como cinco. Da mesma forma, um caractere chinês ou uma letra acentuada como é pode ser um caractere único ou um caractere base mais uma marca de combinação, dependendo de como é codificado.
A diferença se resume ao que você está medindo: Pontos de código Unicode (a unidade técnica), Unidades de código UTF-16 (como alguns sistemas como JavaScript e Twitter os codificam), ou aglomerados de grafemas (o que o usuário vê como um único caractere). Para fins mais práticos, o contador de palavras no TextArray conta grafemas – o que você realmente vê – que corresponde às expectativas do usuário e funciona de forma consistente em emojis, combinando marcas e scripts.
Quando você precisa contar bytes
Limites diferentes se aplicam a locais diferentes. A mídia social geralmente conta caracteres. Campos de banco de dados ou APIs podem contar bytes — as unidades de armazenamento reais após a codificação. Um único emoji ocupa 4 bytes na codificação UTF-8. Um caractere chinês ocupa 3 bytes. Se você estiver colando texto em um sistema com limite de bytes, a contagem de caracteres por si só não dirá se você cabe. O Contador de bytes UTF-8 mostra o custo exato em bytes do seu texto, o que é importante quando você atinge limites de API ou restrições de banco de dados.
Tempo de leitura e contagem de frases
Para escrita mais longa – postagens em blogs, artigos, documentação – a contagem de palavras é menos útil do que o tempo de leitura. Mil palavras são lidas de maneira diferente dependendo do comprimento e da complexidade da frase. O tempo de leitura A ferramenta estima quanto tempo um leitor médio levará para terminar, dando a você uma ideia se a peça é uma leitura rápida ou um mergulho profundo. Ao lado dele, o contador de frases mostra o comprimento médio da frase, que é um sinal grosseiro, mas útil, de legibilidade – frases mais curtas são geralmente mais fáceis de ler.
Todas as contagens são locais e instantâneas
Cada contagem do TextArray é executada inteiramente no seu navegador. Você cola seu texto e os resultados são atualizados instantaneamente. Não há upload, servidor e conta – o texto nunca sai do seu dispositivo. Isso é importante quando você está trabalhando com rascunhos que não publicou, conteúdo confidencial ou qualquer coisa que você prefere não colar em um site aleatório. Você pode se desconectar da rede e as ferramentas continuarão funcionando.