Счетчик байтов UTF-8
Измеряйте реальный размер текста в байтах UTF-8, единицах UTF-16, кодовых точках и графемах.
Счетчик байтов UTF-8
Количество символов и размер байтов — это не одно и то же. В UTF-8 простые английские буквы занимают по одному байту каждая, но «é» занимает два, большинство символов CJK — три, а такой эмодзи, как 👋, — четыре — поэтому сообщение длиной 160 символов может легко превышать 160 байт. Вставьте любой текст, и этот счетчик сообщит его точный размер в байтах UTF-8, кодовые единицы UTF-16, которые будет сообщать JavaScript .length, количество кодовых точек Юникода, количество графем (воспринимаемых пользователем символов, поэтому семейство 👨👩👧 считается за одну) и количество строк, а также сохраненный размер в Б, КБ или МБ для обеих кодировок.
Эта разбивка быстро отвечает на практические вопросы: будет ли эта строка соответствовать столбцу VARCHAR(255), измеряемому в байтах, сегменту SMS, пределу полезной нагрузки в 64 КБ, бюджету заголовка HTTP, квоте localStorage? Почему база данных жалуется на строку «160 символов» и почему смайлик считается как два символа в одной системе и один в другой? Счетчик показывает все конкурирующие определения «длины» рядом, так что вы можете точно увидеть, какое из них используется в вашем лимите.
Окончания строк также имеют значение для размера байтов: файл, сохраненный с окончаниями Windows CRLF, на один байт больше на строку, чем тот же файл с окончаниями Unix LF. Параметр окончания строк позволяет измерять текст в том виде, в каком он был вставлен, или в том виде, в котором он будет преобразован в LF или CRLF.
Все вычисляется локально в вашем браузере с использованием стандартного API TextEncoder — вставляемый вами текст никогда не загружается, поэтому файлы конфигурации, токены и личные сообщения можно безопасно измерять.