Hogyan számoljunk szavakat és karaktereket online (és miért különböznek a számok)
Illessze be ugyanazt a szöveget a Microsoft Wordbe, a Twitterbe, a Google Docsba és egy böngészőszámlálóba, és négy különböző karakterszámot láthat. Ez nem hiba – ez azért van, mert minden alkalmazás valamivel mást számol, és mindegyik technikailag helyes. A különbség megértése akkor számít, amikor egy cikk címét, tweetet vagy SEO-másolatot írsz karakterkorlátozással.
Szavak vs karakterek vs karakterek szóközök nélkül
A szószámláló három egyszerű mérést különböztet meg. Szavak szóközzel vagy írásjellel elválasztott betűk, számok és aposztrófok sorozatai. Karakterek megszámol minden egyes karaktert, beleértve a szóközöket, az írásjeleket és a hangulatjeleket. Karakterek szóközök nélkül hagyja el a szóközt, de hagyjon meg minden mást. A karakterkorlátozott tweeteknél ez a különbség számít: a korlátozás arra vonatkozik, hogy mit számítanak a böngészők, ami teljes karakterszám, beleértve a szóközöket.
Miért nem értenek egyet a Word, a Twitter és a böngészők
A nézeteltérés abból adódik, hogy a különböző rendszerek hogyan ábrázolják a szöveget. A legtöbb angol szöveg egyszerű – egy karakter a szerkesztőben egy egységnek felel meg. De az emoji, a diakritikus és a nem latin betűk kombinációja megtöri ezt a feltételezést. A 👨👩👧 (családi) hangulatjelek egyetlen karakterjelként jeleníthetők meg, de több karakterként vannak kódolva kódpontok (a belső Unicode egységek). A Microsoft Word egy karakternek, a Twitter háromnak, a Unicode-tudatos eszköz pedig ötnek számíthatja. Hasonlóképpen, egy kínai karakter vagy egy ékezetes betű, például az é, lehet egyetlen karakter vagy egy alapkarakter és egy kombinálójel, a kódolástól függően.
A különbség attól függ, hogy mit mér: Unicode kódpontok (a műszaki egység), UTF-16 kódegységek (hogy egyes rendszerek, például a JavaScript és a Twitter hogyan kódolják őket), ill graféma klaszterek (amit a felhasználó egyetlen karakternek lát). A legtöbb gyakorlati célból a szószámláló A TextArray a grafémákat számolja – amit valójában látsz –, amely megfelel a felhasználói elvárásoknak, és következetesen működik az emojikon, kombinálva a jeleket és a szkripteket.
Amikor bájtokat kell számolni
Különböző helyekre eltérő korlátozások vonatkoznak. A közösségi média gyakran számolja a karaktereket. Az adatbázismezők vagy API-k számíthatnak bájtok — a tényleges tárolóegységek a kódolás után. Egyetlen hangulatjel 4 bájtot foglal UTF-8 kódolásban. Egy kínai karakter 3 bájtot vesz igénybe. Ha egy bájtkorlátos rendszerbe illeszt be szöveget, akkor önmagában a karakterszám nem fogja tudni, hogy elfér-e. A UTF-8 bájt számláló megmutatja a szöveg pontos bájtköltségét, ami számít, ha eléri az API-korlátokat vagy az adatbázis-korlátokat.
Az olvasási idő és a mondatok száma
Hosszabb íráshoz – blogbejegyzések, cikkek, dokumentáció – a szószámlálás kevésbé hasznos, mint az olvasási idő. Ezer szó különbözőképpen olvasható a mondat hosszától és összetettségétől függően. A olvasási idő Az eszköz megbecsüli, hogy egy átlagos olvasónak mennyi időbe telik befejezni, így megtudhatja, hogy a darab gyors átfutás vagy mély merülés. Mellette a mondatszámláló az átlagos mondathosszt mutatja, ami nyers, de hasznos jelzés az olvashatóság szempontjából – a rövidebb mondatok általában könnyebben olvashatók.
Minden számlálás helyi és azonnali
A TextArray minden számlálása teljes egészében a böngészőjében fut. Beilleszted a szöveget, és az eredmények azonnal frissülnek. Nincs feltöltés, nincs szerver és nincs fiók – a szöveg soha nem hagyja el az eszközt. Ez akkor számít, ha olyan piszkozatokkal dolgozik, amelyeket még nem tett közzé, érzékeny tartalommal vagy bármi mással, amelyet nem szeretne beilleszteni egy véletlenszerű webhelyre. Lekapcsolhatja a hálózatot, és az eszközök tovább működnek.