Kako brojati riječi i znakove na mreži (i zašto se brojevi razlikuju)
Zalijepite isti tekst u Microsoft Word, Twitter, Google Docs i brojač preglednika i mogli biste vidjeti četiri različita broja znakova. To nije greška — to je zato što svaka aplikacija računa nešto malo drugačije i sve su tehnički ispravne. Razumijevanje razlike važno je kada pišete naslov članka, tweet ili SEO kopiju s ograničenjem broja znakova.
Riječi vs znakovi vs znakovi bez razmaka
The brojač riječi razlikuje tri izravna mjerenja. riječi su nizovi slova, brojeva i apostrofa odvojeni razmakom ili interpunkcijskim znakovima. Likovi brojite svaki pojedini znak, uključujući razmake, interpunkcijske znakove i emojije. Znakovi bez razmaka ispustite razmak, ali zadržite sve ostalo. Za tweet s ograničenjem broja znakova, ova je razlika bitna: ograničenje se primjenjuje na ono što preglednici broje, što je puni broj znakova uključujući razmake.
Zašto se Word, Twitter i preglednici ne slažu
Do neslaganja dolazi zbog toga kako različiti sustavi predstavljaju tekst. Većina engleskog teksta je jasna — jedan znak u uređivaču jednak je jednoj jedinici za računanje. Ali emoji, kombinacija dijakritičkih znakova i nelatiničnih pisama razbijaju tu pretpostavku. Emoji poput 👨👩👧 (obitelj) može se prikazati kao jedan glif, ali je kodiran kao višestruki kodne točke (interne Unicode jedinice). Microsoft Word bi to mogao računati kao jedan znak, Twitter kao tri, a alat koji podržava Unicode kao pet. Slično tome, kineski znak ili slovo s naglaskom kao što je é može biti jedan znak ili osnovni znak plus znak za kombiniranje, ovisno o tome kako je kodiran.
Razlika se svodi na ono što mjerite: Unicode kodne točke (tehnička jedinica), UTF-16 kodne jedinice (kako ih neki sustavi poput JavaScripta i Twittera kodiraju), ili skupovi grafema (ono što korisnik vidi kao jedan znak). Za većinu praktičnih svrha, brojač riječi na TextArray broji grafeme — ono što zapravo vidite — što odgovara očekivanjima korisnika i radi dosljedno na svim emojijima, kombinirajući oznake i skripte.
Kada trebate brojati bajtove
Za različita mjesta vrijede različita ograničenja. Društveni mediji često broje znakove. Polja baze podataka ili API-ji mogu se računati bajtova — stvarne jedinice pohrane nakon kodiranja. Jedan emoji zauzima 4 bajta u UTF-8 kodiranju. Kineski znak zauzima 3 bajta. Ako lijepite tekst u sustav s ograničenjem broja bajtova, sam broj znakova neće vam reći hoćete li stati. The UTF-8 brojač bajtova pokazuje točnu cijenu bajta vašeg teksta, što je važno kada dosegnete ograničenja API-ja ili ograničenja baze podataka.
Vrijeme čitanja i broj rečenica
Za duže pisanje - postove na blogu, članke, dokumentaciju - brojanje riječi manje je korisno od vremena za čitanje. Tisuću riječi čita se različito ovisno o duljini i složenosti rečenice. The vrijeme čitanja alat procjenjuje koliko će vremena trebati prosječnom čitatelju da završi, dajući vam dojam je li članak brzi prelet ili duboki zaron. Uz njega, brojač rečenica pokazuje prosječnu duljinu rečenice, što je grub, ali koristan signal za čitljivost — kraće rečenice obično se lakše čitaju.
Sva brojanja su lokalna i trenutna
Svaki broj na TextArray radi u potpunosti u vašem pregledniku. Zalijepite svoj tekst i rezultati se trenutno ažuriraju. Nema prijenosa, poslužitelja i računa — tekst nikada ne napušta vaš uređaj. To je važno kada radite sa nacrtima koje niste objavili, osjetljivim sadržajem ili bilo čime što radije ne biste zalijepili na nasumično web mjesto. Možete prekinuti vezu s mrežom i alati će nastaviti raditi.