Przejdź do treści
TextArray

Jak liczyć słowa i znaki w Internecie (i dlaczego liczby się różnią)

Blog /

Wklej ten sam tekst do programów Microsoft Word, Twitter, Dokumentów Google i licznika przeglądarki, a możesz zobaczyć cztery różne liczniki znaków. To nie jest błąd — dzieje się tak dlatego, że każda aplikacja liczy coś innego i wszystkie są poprawne technicznie. Zrozumienie różnicy ma znaczenie, gdy piszesz tytuł artykułu, tweet lub kopię SEO z limitem znaków.

Słowa vs znaki vs znaki bez spacji

The licznik słów rozróżnia trzy proste pomiary. Słowa to ciągi liter, cyfr i apostrofów oddzielone białymi znakami lub znakami interpunkcyjnymi. Pismo policz każdy znak, łącznie ze spacjami, znakami interpunkcyjnymi i emoji. Znaki bez spacji usuń białe znaki, ale zachowaj wszystko inne. W przypadku tweeta z limitem znaków to rozróżnienie ma znaczenie: limit dotyczy liczby przeglądarek, czyli pełnej liczby znaków łącznie ze spacjami.

Dlaczego Word, Twitter i przeglądarki się nie zgadzają

Nieporozumienie wynika z tego, jak różne systemy reprezentują tekst. Większość tekstów w języku angielskim jest prosta — jeden znak w edytorze to jedna jednostka do zliczenia. Jednak emoji łączące znaki diakrytyczne i znaki inne niż łacińskie przełamują to założenie. Emoji takie jak 👨‍👩‍👧 (rodzina) mogą być renderowane jako pojedynczy glif, ale są kodowane jako wielokrotne punkty kodowe (wewnętrzne jednostki Unicode). Microsoft Word może policzyć to jako jeden znak, Twitter jako trzy, a narzędzie obsługujące Unicode jako pięć. Podobnie chiński znak lub litera akcentowana, np. é, może być pojedynczym znakiem lub znakiem podstawowym plus znak łączący, w zależności od sposobu kodowania.

Różnica sprowadza się do tego, co mierzysz: Punkty kodowe Unicode (jednostka techniczna), Jednostki kodu UTF-16 (w jaki sposób kodują je niektóre systemy, takie jak JavaScript i Twitter), lub klastry grafemów (co użytkownik widzi jako pojedynczy znak). Dla większości praktycznych celów, licznik słów na TextArray zlicza grafemy — to, co faktycznie widzisz — co odpowiada oczekiwaniom użytkownika i działa spójnie dla wszystkich emoji, łącząc znaki i skrypty.

Kiedy trzeba policzyć bajty

W różnych miejscach obowiązują różne limity. Media społecznościowe często liczą postacie. Pola bazy danych lub interfejsy API mogą się liczyć bajty — rzeczywiste jednostki pamięci po kodowaniu. Pojedynczy emoji zajmuje 4 bajty w kodowaniu UTF-8. Znak chiński zajmuje 3 bajty. Jeśli wklejasz tekst do systemu z limitem bajtów, sama liczba znaków nie powie Ci, czy się zmieścisz. The Licznik bajtów UTF-8 pokazuje dokładny koszt tekstu w bajtach, który ma znaczenie, gdy osiągasz limity API lub ograniczenia bazy danych.

Czas czytania i liczba zdań

W przypadku dłuższego pisania — postów na blogu, artykułów, dokumentacji — liczenie słów jest mniej przydatne niż czas czytania. Tysiąc słów czyta się różnie w zależności od długości i złożoności zdania. The czas czytania Narzędzie szacuje, ile czasu zajmie przeciętnemu czytelnikowi dokończenie lektury, dając ci poczucie, czy utwór jest szybkim przeglądnięciem, czy głębokim zanurzeniem się. Obok niego, licznik zdań pokazuje średnią długość zdania, co jest przybliżonym, ale użytecznym sygnałem czytelności — krótsze zdania są zwykle łatwiejsze do odczytania.

Wszystkie zliczenia są lokalne i natychmiastowe

Każde zliczanie w TextArray działa całkowicie w Twojej przeglądarce. Wklejasz tekst, a wyniki są natychmiast aktualizowane. Nie trzeba przesyłać plików, nie ma serwera ani konta — tekst nigdy nie opuszcza Twojego urządzenia. Ma to znaczenie, gdy pracujesz z niepublikowanymi wersjami roboczymi, treściami wrażliwymi lub czymkolwiek, czego nie chcesz wklejać na przypadkowej stronie internetowej. Możesz odłączyć się od sieci, a narzędzia będą nadal działać.