Preskočiť na obsah
100% lokálne

Inspektor Unicode znakov

Rozloží text na jednotlivé znaky a zobrazí kódový bod, názov, blok, kategóriu a veľkosť každého.

Vstup

Inspektor Unicode znakov

Vložte ľubovoľný text a tento nástroj ho rozloží na jednotlivé znaky, pričom pre každý zobrazí jeho kódový bod (U+XXXX), čitateľný názov, blok Unicode, všeobecnú kategóriu (písmeno, značka, interpunkcia, symbol, oddeľovač alebo ovládací znak), približný smer textu a počet bajtov v kódovaní UTF-8. Nástroj je určený na situácie, keď text vyzerá dobre, ale správa sa nepredpokladaným spôsobom — „inteligentný úvodník“ ktorý zlomí JSON parser, zablúdené meradlá nulowej šírky skopírované z webstránky, homoglyf skrytý v názve domény alebo emoji, ktoré sa v skutočnosti skladá z niekoľkých kódových bodov zlepených dohromady.

Zapnite „zlúčiť rovnaké znaky“ na zlepenie opakovaní do jedného riadku na distinct character s počtom výskytov, čo je najrýchlejší spôsob, ako odpovedať na otázku „aké znaky sa v tomto súbore skutočne nachádzajú a ako často“. Možnosť „len znaky mimo ASCII“ skrýva bežné A-Z, číslice a základnú interpunkciu, takže dlhý dokument zobrazuje iba znaky, ktoré stoja za pozornosť. Možnosť „rozložiť zložené emoji“ rozdelí sekvencie postavené z niekoľkých kódových bodov — príznaky, rodinné emoji, varianty s tónom kože — na ich raw stavebné prvky namiesto zobrazenia celej sekvencie ako jedného riadku; bežné písmená s diakritikou zostanú pohromade aj tak, pretože by bolo len hlukom.

Názvy znakov pochádzajú z veľkej vstavanej tabuľky pokrývajúcej ASCII, latinské znaky s diakritikou (postavené na základe rovnakého pravidla základného písmena plus diakritika, ktoré používa samotný Unicode), cyriliku, gréčtinu, bežné symboly, ideogramy CJK a slabiky Hangul — nie je to kópia plnej databázy s približne 150 000 položkami s názvami Unicode, ktorá by bola príliš veľká na odoslanie do karty prehliadača. Vzácne alebo nepriradené kódové body sa vrátia na popis založený na bloku namiesto hádania a odsek nižšie ukazuje presne, kde je hranica.

Všetko beží lokálne vo vašom prehliadači: text, ktorý inšpektujete, vrátane hesiel, súkromných poznámok alebo čohokoľvek iného, čo by ste neodoslali na náhodný webový formulár, sa nikdy nikam neosiela. Skopírujte výsledok, stiahnite si ho ako súbor .txt alebo ho pošlite priamo do iného nástroja.

Časté otázky

Prečo sa emoji niekedy zobrazuje ako niekoľko riadkov?
Emoji ako príznaky, skupiny rodín alebo varianty s tónom kože sú často postavené z viacerých kódových bodov Unicode spojených dohromady. Nástroj ich štandardne zobrazuje ako jeden znak; zapnite možnosť „rozložiť zložené emoji“ a uvidíte jednotlivé kódové body, ktoré ich tvoria.
Čo tu znamená "blok"?
Blok Unicode je pomenovaný rozsah kódových bodov, ako napríklad „Basic Latin“ alebo „Cyrillic“. Zoskupuje znaky podľa toho, kde sa nachádzajú v štandarde Unicode, čo sa líši od ich všeobecnej kategórie (písmeno, interpunkcia, symbol a podobne).
Sú názvy znakov vždy oficiálny názov Unicode?
Pre ASCII, bežné latinské znaky s diakritikou, cyriliku, gréčtinu, ideogramy CJK, slabiky Hangul a širokú sadu bežných symbolov a emoji áno. Pri vzácnejších kódových bodoch nástroj zobrazuje popisný fallback na základe bloku namiesto toho, aby hádal presný názov — úplná oficiálna databáza názvov má približne 150 000 položiek a nezmestí sa na stránku odoslanú do vášho prehliadača.
Ako sa určuje smer textu?
Je to zjednodušená kontrola, nie úplný algoritmus Unicode bidirectional: písmená zo skriptov sprava doľava (arabčina, hebrejčina a podobne) sú označené ako „rtl“, ostatné písmená a číslice sú označené ako „ltr“ a interpunkcia, symboly a rozostupy sú označené ako „neutral“.
Je môj text niekde odoslaný?
Nie. Každý znak je skúmaný úplne vo vašom prehliadači — nič, čo sem vložíte, sa neodosiela na server.