Перейти до вмісту
100% локально

Інспектор символів Unicode

Розбирає текст на окремі символи і показує кодову точку, назву, блок, категорію та розмір кожного.

Введення

Інспектор символів Unicode

Вставте будь-який текст і цей інструмент розбере його на окремі символи, показавши для кожного його кодову точку (U+XXXX), читаємо назву, блок Unicode, категорію (літера, знак, пунктуація, символ, розділювач або керуючий символ), напрямок тексту та кількість байтів у UTF-8. Інструмент призначений для моментів, коли текст виглядає правильно, але поводиться неочікувано — «розумні лапки» ломають JSON-парсер, невидимі символи нульової ширини скопійовані з веб-сторінки, омоглиф сховано в назві домену або емодзі, що складається з кількох кодових точок.

Увімкніть «об'єднати однакові символи», щоб звести повторення в один рядок для кожного унікального символу з підрахунком входжень — це найшвидший спосіб відповісти на питання "які символи дійсно зустрічаються в цьому файлі і як часто". «Лише символи поза ASCII» приховує звичайні A-Z, цифри та базову пунктуацію, щоб довгий документ показував лише символи, гідні уваги. «Розкласти складені емодзі» розбиває послідовності з кількох кодових точок — прапори, сімейні емодзі, варіанти з різними тонами шкіри — на їхні основні компоненти замість показу всієї послідовності одним рядком. Звичайні літери з діакритикою залишаються разом, оскільки це був би просто шум. Виберіть просту таблицю для читання на екрані або CSV для вставлення в електронну таблицю.

Назви символів беруться з вбудованої таблиці, що охоплює ASCII, латинські літери з діакритикою (побудовані за тим же правилом базова-літера-плюс-діакритика, яке використовує сам Unicode), кирилицю, грецьку, поширені символи, ідеограми CJK та склади Hangul — не повну базу даних з ~150000 офіційних назв Unicode, яка була б надто великою для відправлення на вкладку браузера. Рідкісні або невизначені кодові точки замінюються описом на основі блоку замість вгадування, і часто задавані питання нижче показують ровесно, де проходить лінія.

Усе працює локально у вашому браузері: текст, який ви перевіряєте, включаючи паролі, особисті замітки чи все, що ви не вставили б у випадкову веб-форму, ніколи не відправляється нікуди. Скопіюйте результат, завантажте як .txt-файл або відправте прямо в інший інструмент.

FAQ

Чому емодзі іноді відображається кількома рядками?
Емодзі типу прапорів, сімейних груп або варіантів з різними тонами шкіри часто складаються з кількох кодових точок Unicode, об'єднаних разом. За замовчуванням інструмент показує їх як один символ; увімкніть «розкласти складені емодзі», щоб бачити окремі кодові точки.
Що тут означає "блок"?
Блок Unicode — це іменований діапазон кодових точок, наприклад "Basic Latin" або "Cyrillic". Він групує символи за їхнім розташуванням у стандарті Unicode, що відрізняється від їхної загальної категорії (літера, пунктуація, символ тощо).
Це завжди офіційна назва Unicode?
Для ASCII, поширених латинських літер з діакритикою, кирилиці, грецької, ідеограм CJK, складів Hangul і широкого набору поширених символів та емодзі — так. Для рідших кодових точок інструмент показує описовий fallback на основі блоку замість вгадування точної назви — повна офіційна база даних назв містить близько 150000 записів і не вміщується на сторінку, відправлену у ваш браузер.
Як визначається напрямок тексту?
Це спрощена перевірка, а не повний алгоритм двобічності Unicode: літери з систем письма справа-наліво (арабська, іврит та подібні) позначені як "rtl", інші літери та цифри як "ltr", пунктуація, символи та пробіли як "neutral".
Мій текст відправляється кудись?
Ні. Кожен символ перевіряється повністю у вашому браузері — ніщо з того, що ви вставляєте тут, не відправляється на сервер.