Preskoči na vsebino
TextArray

Kako prešteti besede in znake na spletu (in zakaj se številke razlikujejo)

Blog /

Prilepite isto besedilo v Microsoft Word, Twitter, Google Dokumente in števec brskalnika in morda boste videli štiri različna števila znakov. To ni napaka - to je zato, ker vsaka aplikacija šteje nekaj nekoliko drugačnega in so vse tehnično pravilne. Razumevanje razlike je pomembno, ko pišete naslov članka, tvit ali kopijo SEO z omejitvijo znakov.

Besede proti znakom proti znakom brez presledkov

The števec besed razlikuje med tremi enostavnimi meritvami. Besede so zaporedja črk, številk in apostrofov, ločenih s presledki ali ločili. Znaki preštejte vsak posamezen znak, vključno s presledki, ločili in emoji. Znaki brez presledkov izpustite prazen prostor, vendar obdržite vse ostalo. Za tweet z omejitvijo znakov je to razlikovanje pomembno: omejitev velja za število brskalnikov, ki štejejo, kar je celotno število znakov, vključno s presledki.

Zakaj se Word, Twitter in brskalniki ne strinjajo

Do nesoglasja pride zaradi tega, kako različni sistemi predstavljajo besedilo. Večina angleških besedil je enostavnih - en znak v urejevalniku je enak eni enoti za štetje. Toda emoji, ki združujejo diakritične znake in nelatinične pisave, kršijo to domnevo. Emoji, kot je 👨‍👩‍👧 (družina), je lahko upodobljen kot en glif, vendar je kodiran kot več kodne točke (notranje enote Unicode). Microsoft Word ga lahko šteje kot en znak, Twitter kot tri, orodje, ki podpira Unicode, pa kot pet. Podobno je lahko kitajski znak ali črka z naglasom, kot je é, en sam znak ali osnovni znak in znak za združevanje, odvisno od tega, kako je kodiran.

Razlika je v tem, kaj merite: Kodne točke Unicode (tehnična enota), kodne enote UTF-16 (kako jih kodirajo nekateri sistemi, kot sta JavaScript in Twitter), oz grafemski skupki (kar uporabnik vidi kot en znak). Za večino praktičnih namenov je števec besed na TextArray šteje grafeme – kar dejansko vidite – kar se ujema s pričakovanji uporabnikov in deluje dosledno v vseh emodžijih, združuje oznake in skripte.

Ko morate prešteti bajte

Za različna mesta veljajo različne omejitve. Družbeni mediji pogosto štejejo znake. Polja zbirke podatkov ali API-ji lahko štejejo bajtov — dejanske pomnilniške enote po kodiranju. Posamezni emoji ima 4 bajte v kodiranju UTF-8. Kitajski znak ima 3 bajte. Če lepite besedilo v sistem z omejitvijo bajtov, vam samo število znakov ne bo povedalo, ali boste ustrezali. The Števec bajtov UTF-8 prikazuje natančno ceno bajtov vašega besedila, kar je pomembno, ko dosežete omejitve API-ja ali omejitve zbirke podatkov.

Čas branja in število stavkov

Za daljše pisanje – objave v spletnem dnevniku, članke, dokumentacijo – je štetje besed manj uporabno kot čas branja. Tisoč besed se bere različno, odvisno od dolžine stavka in zapletenosti. The čas branja orodje oceni, koliko časa bo povprečni bralec potreboval, da konča, kar vam daje občutek, ali gre za hiter pregled ali globok potop. Poleg tega je števec stavkov prikazuje povprečno dolžino stavka, kar je grob, a uporaben signal za berljivost – krajše stavke je običajno lažje brati.

Vsa štetja so lokalna in takojšnja

Vsako število na TextArray se v celoti izvaja v vašem brskalniku. Prilepite svoje besedilo in rezultati se takoj posodobijo. Ni nalaganja, strežnika in računa – besedilo nikoli ne zapusti vaše naprave. To je pomembno, ko delate z osnutki, ki jih niste objavili, občutljivo vsebino ali karkoli, česar raje ne bi prilepili na naključno spletno mesto. Lahko prekinete povezavo z omrežjem in orodja še naprej delujejo.