Як рахувати слова та символи онлайн (і чому цифри відрізняються)
Вставте той самий текст у Microsoft Word, Twitter, Google Docs і лічильник браузера, і ви побачите чотири різні кількості символів. Це не помилка — це тому, що кожна програма враховує щось дещо інше, і всі вони технічно правильні. Розуміння різниці має значення, коли ви пишете назву статті, твіт чи копію SEO з обмеженням кількості символів.
Слова проти символів проти символів без пробілів
The лічильник слів розрізняє три прості вимірювання. Слова це послідовності літер, цифр і апострофів, розділених пробілами або знаками пунктуації. Персонажі рахуйте кожен окремий символ, включаючи пробіли, знаки пунктуації та емодзі. Символи без пробілів опустіть пробіли, але збережіть усе інше. Для твіту з обмеженням кількості символів ця відмінність має значення: обмеження застосовується до того, які браузери враховуються, тобто повної кількості символів, включаючи пробіли.
Чому Word, Twitter і браузери не погоджуються
Розбіжності виникають через те, як різні системи представляють текст. Більшість англійських текстів є простими — один символ у редакторі дорівнює одній одиниці для підрахунку. Але емодзі, що поєднують діакритичні знаки та нелатинські шрифти, порушують це припущення. Смайли на зразок 👨👩👧 (сім’я) можуть відображатися як один гліф, але кодуються як кілька кодові точки (внутрішні одиниці Unicode). Microsoft Word може рахувати це як один символ, Twitter як три, а інструмент, що підтримує Unicode, як п’ять. Подібним чином китайський ієрогліф або літера з акцентом, як-от é, можуть бути одним символом або базовим символом із позначкою об’єднання, залежно від того, як вони закодовані.
Різниця зводиться до того, що ви вимірюєте: Кодові точки Unicode (технічний блок), Кодові одиниці UTF-16 (як деякі системи, такі як JavaScript і Twitter, кодують їх), або кластери графем (те, що користувач бачить як один символ). Для більшості практичних цілей лічильник слів on TextArray підраховує графеми — те, що ви насправді бачите — що відповідає очікуванням користувачів і працює послідовно в усіх емодзі, поєднуючи позначки та сценарії.
Коли потрібно порахувати байти
Для різних місць застосовуються різні обмеження. Соціальні мережі часто підраховують персонажів. Поля бази даних або API можуть враховуватися байтів — фактичні одиниці зберігання після кодування. Один емодзі займає 4 байти в кодуванні UTF-8. Китайський символ займає 3 байти. Якщо ви вставляєте текст у систему з обмеженням у байтах, сама лише кількість символів не скаже вам, чи підійдете ви. The Лічильник байтів UTF-8 показує точну вартість вашого тексту в байтах, що має значення, коли ви досягаєте обмежень API або обмежень бази даних.
Час читання та кількість речень
Для більш тривалого написання — публікацій у блогах, статей, документації — підрахунок слів менш корисний, ніж час на читання. Тисяча слів читається по-різному залежно від довжини речення та складності. The час читання інструмент оцінює, скільки часу знадобиться середньостатистичному читачеві, щоб закінчити, дає вам уявлення про те, чи є твір швидким переглядом чи глибоким зануренням. Поряд з ним, лічильник речень показує середню довжину речення, що є грубим, але корисним сигналом для читабельності — коротші речення зазвичай читаються легше.
Усі підрахунки локальні та миттєві
Кожен підрахунок на TextArray працює повністю у вашому браузері. Ви вставляєте текст, і результати миттєво оновлюються. Немає завантаження, сервера та облікового запису — текст ніколи не покидає ваш пристрій. Це важливо, коли ви працюєте з чернетками, які ви не публікували, конфіденційним вмістом або будь-чим іншим, що ви не хочете вставляти на випадковий веб-сайт. Ви можете відключитися від мережі, і інструменти продовжать працювати.