UTF-8 brojač bajtova
Izmjerite stvarnu veličinu teksta u UTF-8 bajtovima, UTF-16 jedinicama, kodnim točkama i grafemima.
UTF-8 brojač bajtova
Broj znakova i veličina bajtova nisu ista stvar. U UTF-8, obična engleska slova zauzimaju po jedan bajt, ali "é" zauzima dva, većina CJK znakova zauzima tri, a emoji kao što je 👋 zauzima četiri — tako da poruka od 160 znakova može lako imati više od 160 bajtova. Zalijepite bilo koji tekst i ovaj brojač javlja njegovu točnu veličinu UTF-8 bajta, UTF-16 kodne jedinice koje bi JavaScript .length prijavio, broj Unicode kodnih točaka, broj grafema (korisnički percipirani znakovi, tako da se obitelj 👨👩👧 računa kao jedan) i broj redaka, plus pohranjena veličina u B, KB ili MB za oboje kodiranja.
Ta raščlamba brzo odgovara na praktična pitanja: hoće li ovaj niz odgovarati stupcu VARCHAR(255) mjerenom u bajtovima, SMS segmentu, ograničenju nosivosti od 64 KB, proračunu HTTP zaglavlja, kvoti localStorage? Zašto se baza podataka žali na niz od "160 znakova" i zašto se emoji računa kao dva znaka u jednom sustavu i jedan u drugom? Brojač prikazuje sve konkurentske definicije "dužine" jednu pored druge tako da možete točno vidjeti koju koristi vaše ograničenje.
Završeci redaka također su važni za veličinu bajta: datoteka spremljena sa Windows CRLF završecima je jedan bajt po retku veća od iste datoteke s Unix LF završecima. Opcija završetaka redaka omogućuje vam mjerenje teksta kao što je zalijepljen ili kako bi se jednom pretvorio u LF ili CRLF.
Sve se izračunava lokalno u vašem pregledniku pomoću standardnog TextEncoder API-ja — tekst koji zalijepite nikada se ne učitava, tako da su konfiguracijske datoteke, tokeni i privatne poruke sigurni za mjerenje.