Števec bajtov UTF-8
Izmerite dejansko velikost besedila v bajtih UTF-8, enotah UTF-16, kodnih točkah in grafemih.
Števec bajtov UTF-8
Število znakov in velikost bajtov nista ista stvar. V UTF-8 navadne angleške črke zasedajo en bajt, vendar "é" potrebuje dva, večina znakov CJK potrebuje tri in emoji, kot je 👋, potrebuje štiri - tako da je lahko sporočilo s 160 znaki enostavno veliko več kot 160 bajtov. Prilepite poljubno besedilo in ta števec sporoči njegovo natančno velikost bajtov UTF-8, kodne enote UTF-16, ki bi jih poročal JavaScript .length, število kodnih točk Unicode, število grafemov (znaki, ki jih zazna uporabnik, tako da družina 👨👩👧 šteje kot ena) in število vrstic ter shranjena velikost v B, KB ali MB za oboje kodiranja.
Ta razčlenitev hitro odgovarja na praktična vprašanja: ali bo ta niz ustrezal stolpcu VARCHAR(255), merjenemu v bajtih, segmentu SMS, omejitvi obremenitve 64 KB, proračunu glave HTTP, kvoti localStorage? Zakaj se baza podatkov pritožuje nad nizom s "160 znaki" in zakaj emoji šteje kot dva znaka v enem sistemu in en v drugem? Števec prikazuje vse konkurenčne definicije "dolžine" eno poleg druge, tako da lahko natančno vidite, katero uporablja vaša omejitev.
Tudi končnice vrstic so pomembne za velikost bajtov: datoteka, shranjena s končnicami Windows CRLF, je en bajt na vrstico večja od iste datoteke s končnicami Unix LF. Možnost končnic vrstic vam omogoča merjenje besedila kot je prilepljeno ali kot bi bilo nekoč pretvorjeno v LF ali CRLF.
Vse se izračuna lokalno v vašem brskalniku s standardnim API-jem TextEncoder — besedilo, ki ga prilepite, ni nikoli naloženo, zato je konfiguracijske datoteke, žetone in zasebna sporočila varno meriti.