Compteur d'octets UTF-8
Mesurez la taille réelle du texte en octets UTF-8, unités UTF-16, points de code et graphèmes.
Compteur d'octets UTF-8
Le nombre de caractères et la taille des octets ne sont pas la même chose. En UTF-8, les lettres anglaises simples prennent un octet chacune, mais « é » en prend deux, la plupart des caractères CJK en prennent trois et un emoji comme 👋 en prend quatre — donc un message de 160 caractères peut facilement faire bien plus de 160 octets. Collez n'importe quel texte et ce compteur indique sa taille exacte en octets UTF-8, les unités de code UTF-16 que JavaScript .length rapporterait, le nombre de points de code Unicode, le nombre de graphèmes (caractères perçus par l'utilisateur, donc une famille 👨👩👧 compte pour une) et le nombre de lignes, plus la taille stockée en B, Ko ou Mo pour les deux encodages.
Cette répartition répond rapidement aux questions pratiques : cette chaîne s'adaptera-t-elle à une colonne VARCHAR(255) mesurée en octets, un segment SMS, une limite de charge utile de 64 Ko, un budget d'en-tête HTTP, un quota de stockage local ? Pourquoi une base de données se plaint-elle d'une chaîne de « 160 caractères » et pourquoi un emoji compte-t-il pour deux caractères dans un système et un dans un autre ? Le compteur affiche toutes les définitions concurrentes de « longueur » côte à côte afin que vous puissiez voir exactement laquelle utilise votre limite.
Les fins de ligne sont également importantes pour la taille des octets : un fichier enregistré avec les terminaisons Windows CRLF est plus grand d'un octet par ligne que le même fichier avec les terminaisons Unix LF. L'option de fin de ligne vous permet de mesurer le texte tel qu'il est collé ou tel qu'il le serait une fois converti en LF ou CRLF.
Tout est calculé localement dans votre navigateur à l'aide de l'API TextEncoder standard : le texte que vous collez n'est jamais téléchargé, les fichiers de configuration, les jetons et les messages privés peuvent donc être mesurés en toute sécurité.