Как посчитать слова и символы онлайн (и почему цифры различаются)
Вставьте один и тот же текст в Microsoft Word, Twitter, Google Docs и счетчик браузера, и вы увидите четыре разных количества символов. Это не ошибка, а потому, что каждое приложение считает что-то по-своему, и все они технически корректны. Понимание разницы имеет значение, когда вы пишете заголовок статьи, твит или SEO-текст с ограничением количества символов.
Слова против символов против символов без пробелов
счетчик слов различает три простых измерения. Слова представляют собой последовательности букв, цифр и апострофов, разделенных пробелами или знаками препинания. Персонажи посчитайте каждый символ, включая пробелы, знаки препинания и смайлики. Символы без пробелов оставьте пробелы, но сохраните все остальное. Для твита с ограничением на количество символов это различие имеет значение: ограничение применяется к тому, что браузеры считают, то есть к полному количеству символов, включая пробелы.
Почему Word, Twitter и браузеры расходятся во мнениях
Разногласия возникают из-за того, как разные системы представляют текст. Большинство текстов на английском языке просты: один символ в редакторе равен одной единице счета. Но смайлики, сочетающие диакритические знаки и нелатинские буквы, нарушают это предположение. Такой смайлик, как 👨👩👧 (семья), может отображаться как один глиф, но закодирован как несколько. кодовые точки (внутренние единицы Юникода). Microsoft Word может посчитать его за один символ, Twitter — за три, а инструмент, поддерживающий Unicode, — за пять. Точно так же китайский иероглиф или буква с диакритическим знаком, например é, может быть одним символом или базовым символом плюс объединяющий знак, в зависимости от того, как он закодирован.
Разница сводится к тому, что вы измеряете: Кодовые точки Юникода (технический блок), Кодовые единицы UTF-16 (как их кодируют некоторые системы, такие как JavaScript и Twitter), или кластеры графем (то, что пользователь видит как один символ). Для большинства практических целей счетчик слов на TextArray подсчитывает графемы — то, что вы на самом деле видите — что соответствует ожиданиям пользователей и одинаково работает с эмодзи, комбинируя знаки и сценарии.
Когда нужно посчитать байты
В разных местах действуют разные ограничения. Социальные сети часто считают персонажей. Поля базы данных или API могут иметь значение байты — фактические единицы хранения после кодирования. Один смайлик занимает 4 байта в кодировке UTF-8. Китайский иероглиф занимает 3 байта. Если вы вставляете текст в систему с ограничением в байтах, одно только количество символов не скажет вам, подойдет ли он. Счетчик байтов UTF-8 показывает точную стоимость вашего текста в байтах, что имеет значение, когда вы достигаете ограничений API или базы данных.
Время чтения и количество предложений
Для более длинных текстов — сообщений в блогах, статей, документации — количество слов менее полезно, чем время чтения. Тысяча слов читается по-разному в зависимости от длины и сложности предложения. время чтения Инструмент оценивает, сколько времени потребуется среднему читателю, чтобы прочитать текст, давая вам представление о том, является ли статья быстрым беглым просмотром или глубоким погружением. Наряду с этим, счетчик предложений показывает среднюю длину предложения, что является грубым, но полезным сигналом для читабельности — более короткие предложения обычно легче читать.
Все подсчеты являются локальными и мгновенными.
Все расчеты на TextArray полностью выполняются в вашем браузере. Вы вставляете текст, и результаты мгновенно обновляются. Нет никакой загрузки, никакого сервера и никакой учетной записи — текст никогда не покидает ваше устройство. Это имеет значение, когда вы работаете с черновиками, которые вы не публиковали, конфиденциальным контентом или чем-то еще, что вы не хотели бы вставлять на случайный веб-сайт. Вы можете отключиться от сети, и инструменты продолжат работать.