Přeskočit na obsah
TextArray

Jak počítat slova a znaky online (a proč se čísla liší)

Blog /

Vložte stejný text do aplikací Microsoft Word, Twitter, Dokumenty Google a počítadla prohlížeče a můžete vidět čtyři různé počty znaků. Není to chyba – je to proto, že každá aplikace počítá něco trochu jiného a všechny jsou technicky správné. Pochopení rozdílu je důležité, když píšete název článku, tweet nebo SEO kopii s omezeným počtem znaků.

Slova vs znaky vs znaky bez mezer

Počítadlo slov rozlišuje mezi třemi přímými měřeními. Slova jsou sekvence písmen, čísel a apostrofů oddělené mezerou nebo interpunkcí. Postavy počítejte každý jednotlivý znak včetně mezer, interpunkce a emotikonů. Znaky bez mezer zrušte mezery, ale ponechte vše ostatní. U tweetu s omezeným počtem znaků je tento rozdíl důležitý: limit se vztahuje na to, co prohlížeče počítají, což je úplný počet znaků včetně mezer.

Proč Word, Twitter a prohlížeče nesouhlasí

K neshodě dochází kvůli tomu, jak různé systémy reprezentují text. Většina anglického textu je přímočará – jeden znak v editoru se rovná jedné jednotce k počítání. Ale emotikony, kombinace diakritiky a nelatinkových skriptů tento předpoklad porušují. Emoji jako 👨‍👩‍👧 (rodina) může být vykresleno jako jeden glyf, ale je zakódováno jako více kódové body (vnitřní jednotky Unicode). Microsoft Word to může počítat jako jeden znak, Twitter jako tři a nástroj podporující Unicode jako pět. Podobně čínský znak nebo písmeno s diakritikou, jako je é, může být jedním znakem nebo základním znakem plus kombinační značkou, v závislosti na tom, jak je zakódováno.

Rozdíl spočívá v tom, co měříte: Body kódu Unicode (technická jednotka), Jednotky kódu UTF-16 (jak je kódují některé systémy jako JavaScript a Twitter), popř shluky grafémů (co uživatel vidí jako jeden znak). Pro většinu praktických účelů je počítadlo slov na TextArray počítá grafémy – to, co skutečně vidíte – což odpovídá očekávání uživatelů a funguje konzistentně napříč emotikony, kombinuje značky a skripty.

Když potřebujete počítat bajty

Pro různá místa platí různé limity. Sociální sítě často počítají postavy. Databázová pole nebo rozhraní API se mohou počítat bajtů — skutečné paměťové jednotky po zakódování. Jeden emotikon zabere 4 bajty v kódování UTF-8. Čínský znak trvá 3 bajty. Pokud vkládáte text do systému s limitem bajtů, samotný počet znaků vám neřekne, zda se vejdete. Čítač bajtů UTF-8 zobrazuje přesnou cenu bajtů vašeho textu, což je důležité, když narazíte na limity API nebo omezení databáze.

Doba čtení a počet vět

Pro delší psaní – blogové příspěvky, články, dokumentace – je počet slov méně užitečný než čas na čtení. Tisíc slov se čte různě v závislosti na délce a složitosti věty. čas čtení Nástroj odhaduje, jak dlouho bude průměrnému čtenáři trvat, než ho dokončí, a dá vám představu, zda jde o rychlý let nebo hluboký ponor. Vedle toho, čítač vět ukazuje průměrnou délku věty, což je hrubý, ale užitečný signál pro čitelnost – kratší věty se obvykle čtou snadněji.

Všechny počty jsou lokální a okamžité

Každý počet na TextArray běží výhradně ve vašem prohlížeči. Vložíte svůj text a výsledky se okamžitě aktualizují. Žádné nahrávání, žádný server ani účet – text nikdy neopustí vaše zařízení. Na tom záleží, když pracujete s koncepty, které jste nepublikovali, citlivým obsahem nebo čímkoli, co byste raději nevkládali na náhodný web. Můžete se odpojit od sítě a nástroje fungují dál.