Preskoči na sadržaj
TextArray
100% lokalno

UTF-8 brojač bajtova

Izmjerite stvarnu veličinu teksta u UTF-8 bajtovima, UTF-16 jedinicama, kodnim točkama i grafemima.

Unos
Rezultat

UTF-8 brojač bajtova

Broj znakova i veličina bajtova nisu ista stvar. U UTF-8, obična engleska slova zauzimaju po jedan bajt, ali "é" zauzima dva, većina CJK znakova zauzima tri, a emoji kao što je 👋 zauzima četiri — tako da poruka od 160 znakova može lako imati više od 160 bajtova. Zalijepite bilo koji tekst i ovaj brojač javlja njegovu točnu veličinu UTF-8 bajta, UTF-16 kodne jedinice koje bi JavaScript .length prijavio, broj Unicode kodnih točaka, broj grafema (korisnički percipirani znakovi, tako da se obitelj 👨‍👩‍👧 računa kao jedan) i broj redaka, plus pohranjena veličina u B, KB ili MB za oboje kodiranja.

Ta raščlamba brzo odgovara na praktična pitanja: hoće li ovaj niz odgovarati stupcu VARCHAR(255) mjerenom u bajtovima, SMS segmentu, ograničenju nosivosti od 64 KB, proračunu HTTP zaglavlja, kvoti localStorage? Zašto se baza podataka žali na niz od "160 znakova" i zašto se emoji računa kao dva znaka u jednom sustavu i jedan u drugom? Brojač prikazuje sve konkurentske definicije "dužine" jednu pored druge tako da možete točno vidjeti koju koristi vaše ograničenje.

Završeci redaka također su važni za veličinu bajta: datoteka spremljena sa Windows CRLF završecima je jedan bajt po retku veća od iste datoteke s Unix LF završecima. Opcija završetaka redaka omogućuje vam mjerenje teksta kao što je zalijepljen ili kako bi se jednom pretvorio u LF ili CRLF.

Sve se izračunava lokalno u vašem pregledniku pomoću standardnog TextEncoder API-ja — tekst koji zalijepite nikada se ne učitava, tako da su konfiguracijske datoteke, tokeni i privatne poruke sigurni za mjerenje.

FAQ

Zašto je broj bajtova veći od broja znakova?
UTF-8 je kodiranje promjenjive širine: ASCII slova zauzimaju 1 bajt, latinična slova s akcentima 2, većina CJK znakova 3 i emotikoni 4. Stoga je svaki tekst koji nije ASCII veći u bajtovima nego u znakovima.
Koja je razlika između kodnih točaka i grafema?
Kodna točka je jedna Unicode vrijednost; grafem je ono što čitatelj vidi kao jedan znak. Emotikoni sačinjeni od nekoliko kodnih točaka spojenih ZWJ, ili slova s kombiniranim naglascima, više su kodnih točaka, ali jedan grafem.
Koji broj koristi ograničenje stupca baze podataka?
Ovisi o bazi podataka i definiciji stupca — MySQL utf8mb4 VARCHAR ograničenja broje znakove dok mnoga ograničenja temeljena na bajtovima (Redis ključevi, veličine indeksa, neki API-ji) broje UTF-8 bajtove. Ovaj alat prikazuje oba kako biste mogli usporediti s onim pravim.
Kako završeci linija mijenjaju veličinu?
Windows CRLF završeci su dva bajta po prijelomu retka, Unix LF završeci jedan. Promijenite opciju završetka redaka da biste vidjeli veličinu teksta kako bi bio spremljen s bilo kojom konvencijom.
Je li moj tekst negdje uploadan?
Ne. Brojenje se u potpunosti izvodi u vašem pregledniku s ugrađenim TextEncoder API-jem i vaš tekst nikada ne napušta vaš uređaj.