Перейти к содержанию
100% локально

Инспектор символов Unicode

Разбирает текст на отдельные символы и показывает кодовую точку, название, блок, категорию и размер каждого.

Входные данные
Выходные данные

Инспектор символов Unicode

Вставьте любой текст и этот инструмент разберёт его на отдельные символы, показав для каждого его кодовую точку (U+XXXX), читаемое имя, блок Unicode, категорию (буква, знак, пунктуация, символ, разделитель или управляющий символ), направление текста и количество байт в UTF-8. Инструмент предназначен для моментов, когда текст выглядит правильно, но ведёт себя неожиданно — "умные кавычки" ломают JSON-парсер, невидимые символы нулевой ширины скопированы с веб-страницы, омоглиф спрятан в имени домена или эмодзи, состоящее из нескольких кодовых точек.

Включите «объединить идентичные символы», чтобы свести повторения в одну строку для каждого уникального символа с подсчётом вхождений — это самый быстрый способ ответить на вопрос "какие символы действительно встречаются в этом файле и как часто". «Только символы вне ASCII» скрывает обычные A-Z, цифры и базовую пунктуацию, так что длинный документ показывает только символы, достойные внимания. «Разложить составные эмодзи» разбивает последовательности из нескольких кодовых точек — флаги, семейные эмодзи, варианты с разными тонами кожи — на их основные компоненты вместо показа всей последовательности одной строкой. Обычные буквы с диакритикой остаются вместе, так как это был бы просто шум. Выберите простую таблицу для чтения на экране или CSV для вставки в электронную таблицу.

Названия символов берут из встроенной таблицы, охватывающей ASCII, латинские буквы с диакритикой (построенные по тому же правилу базовая-буква-плюс-диакритика, которое использует сам Unicode), кириллицу, греческий, распространённые символы, идеограммы CJK и слоги Hangul — не полную базу данных с ~150000 официальных имён Unicode, которая была бы слишком велика для отправки на вкладку браузера. Редкие или неопределённые кодовые точки подменяются описанием на основе блока вместо угадывания, и часто задаваемые вопросы ниже показывают ровно, где проходит линия.

Всё работает локально в вашем браузере: текст, который вы проверяете, включая пароли, личные заметки или что-либо, что вы не вставили бы в случайную веб-форму, никогда не отправляется никуда. Скопируйте результат, загрузите как .txt-файл или отправьте прямо в другой инструмент.

FAQ

Почему эмодзи иногда отображается несколькими строками?
Эмодзи типа флагов, семейных групп или вариантов с разными тонами кожи часто состоят из нескольких кодовых точек Unicode, объединённых вместе. По умолчанию инструмент показывает их как один символ; включите «разложить составные эмодзи», чтобы увидеть отдельные кодовые точки.
Что здесь означает "блок"?
Блок Unicode — это именованный диапазон кодовых точек, например "Basic Latin" или "Cyrillic". Он группирует символы по их расположению в стандарте Unicode, что отличается от их общей категории (буква, пунктуация, символ и т.д.).
Это всегда официальное имя Unicode?
Для ASCII, распространённых латинских букв с диакритикой, кириллицы, греческого, идеограмм CJK, слогов Hangul и широкого набора распространённых символов и эмодзи — да. Для редких кодовых точек инструмент показывает описательный fallback на основе блока вместо угадывания точного имени — полная официальная база данных имён содержит около 150000 записей и не помещается на страницу, отправляемую в ваш браузер.
Как определяется направление текста?
Это упрощённая проверка, а не полный алгоритм двусторонности Unicode: буквы из систем письма справа-налево (арабский, иврит и им подобные) отмечены как "rtl", остальные буквы и цифры как "ltr", пунктуация, символы и пробелы как "neutral".
Мой текст отправляется куда-нибудь?
Нет. Каждый символ проверяется полностью в вашем браузере — ничто из того, что вы здесь вставляете, не отправляется на сервер.