Preskočiť na obsah
TextArray

Ako počítať slová a znaky online (a prečo sa čísla líšia)

Blog /

Prilepte rovnaký text do aplikácií Microsoft Word, Twitter, Dokumenty Google a počítadla prehliadača a môžete vidieť štyri rôzne počty znakov. Nie je to chyba - je to preto, že každá aplikácia počíta niečo trochu iné a všetky sú technicky správne. Pochopenie rozdielu je dôležité pri písaní názvu článku, tweetu alebo SEO kópie s obmedzeným počtom znakov.

Slová vs znaky vs znaky bez medzier

Počítadlo slov rozlišuje medzi tromi priamymi meraniami. Slová sú sekvencie písmen, číslic a apostrofov oddelené medzerami alebo interpunkciou. Postavy spočítajte každý jeden znak vrátane medzier, interpunkcie a emotikonov. Znaky bez medzier vypustite medzery, ale ponechajte všetko ostatné. Pre tweet s obmedzeným počtom znakov je tento rozdiel dôležitý: limit sa vzťahuje na počet prehliadačov, čo je úplný počet znakov vrátane medzier.

Prečo Word, Twitter a prehliadače nesúhlasia

K nezhode dochádza kvôli tomu, ako rôzne systémy reprezentujú text. Väčšina anglického textu je jednoduchá - jeden znak v editore sa rovná jednej jednotke, ktorú treba počítať. Emoji, kombinovanie diakritiky a nelatinkových skriptov však tento predpoklad porušujú. Emoji ako 👨‍👩‍👧 (rodina) možno vykresliť ako jeden glyf, ale je zakódovaný ako viacero kódové body (interné jednotky Unicode). Microsoft Word to môže počítať ako jeden znak, Twitter ako tri a nástroj podporujúci Unicode ako päť. Podobne čínsky znak alebo písmeno s diakritikou, napríklad é, môže byť jedným znakom alebo základným znakom plus kombinovaná značka, v závislosti od toho, ako je zakódovaný.

Rozdiel spočíva v tom, čo meriate: Body kódu Unicode (technická jednotka), Jednotky kódu UTF-16 (ako ich kódujú niektoré systémy ako JavaScript a Twitter), príp zhluky grafém (čo používateľ vidí ako jeden znak). Pre väčšinu praktických účelov, počítadlo slov na TextArray počíta grafémy - to, čo skutočne vidíte - čo zodpovedá očakávaniam používateľov a funguje konzistentne v rámci emotikonov, pričom kombinuje značky a skripty.

Keď potrebujete počítať bajty

Pre rôzne miesta platia rôzne limity. Sociálne siete často počítajú postavy. Databázové polia alebo rozhrania API sa môžu počítať bajtov — skutočné pamäťové jednotky po zakódovaní. Jeden emotikon zaberie 4 bajty v kódovaní UTF-8. Čínsky znak trvá 3 bajty. Ak vkladáte text do systému s limitom bajtov, samotný počet znakov vám nepovie, či sa zmestí. Počítadlo UTF-8 bajtov zobrazuje presné bajtové náklady vášho textu, čo je dôležité, keď narazíte na limity API alebo obmedzenia databázy.

Čas čítania a počet viet

Pri dlhšom písaní - blogových príspevkoch, článkoch, dokumentácii - je počet slov menej užitočný ako čas na čítanie. Tisíc slov sa číta inak v závislosti od dĺžky a zložitosti vety. čas čítania Nástroj odhaduje, ako dlho bude priemernému čitateľovi trvať, kým ho dokončí, čo vám dáva predstavu o tom, či ide o rýchly let alebo hlboký ponor. Popri tom, počítadlo viet zobrazuje priemernú dĺžku vety, čo je hrubý, ale užitočný signál pre čitateľnosť - kratšie vety sa zvyčajne čítajú ľahšie.

Všetky počty sú lokálne a okamžité

Každé spoľahnutie na TextArray beží výhradne vo vašom prehliadači. Prilepíte svoj text a výsledky sa okamžite aktualizujú. Neexistuje žiadne nahrávanie, žiadny server ani účet - text nikdy neopustí vaše zariadenie. Na tom záleží, keď pracujete s konceptmi, ktoré ste nezverejnili, citlivým obsahom alebo čímkoľvek, čo by ste radšej nevložili na náhodnú webovú stránku. Môžete sa odpojiť od siete a nástroje budú naďalej fungovať.