Přeskočit na obsah
100% lokálně

Inspektor znaků Unicode

Rozloží text na jednotlivé znaky a zobrazí kódový bod, název, blok, kategorii a velikost každého.

Vstup

Inspektor znaků Unicode

Vložte libovolný text a tento nástroj jej rozloží na jednotlivé znaky, přičemž pro každý zobrazí jeho kódový bod (U+XXXX), čitelné jméno, blok Unicode, obecnou kategorii (písmeno, značka, interpunkce, symbol, oddělovač nebo ovládací znak), přibližný směr textu a počet bajtů v kódování UTF-8. Nástroj je určen pro situace, kdy text vypadá dobře, ale chová se neočekávaně — „chytrý uvozovací znak“ který zlomí JSON parser, zabloudené znaky nulové šířky zkopírované z webové stránky, homoglyf skrytý v názvu domény nebo emoji, které se ve skutečnosti skládá z několika kódových bodů slepených dohromady.

Zapněte „sloučit stejné znaky“ na sloučení opakování do jedného řádku na odlišný znak s počtem výskytů, což je nejrychlejší způsob, jak odpovědět na otázku „jaké znaky se v tomto souboru skutečně vyskytují a jak často“. Možnost „pouze znaky mimo ASCII“ skrývá běžné A-Z, číslice a základní interpunkci, takže dlouhý dokument zobrazuje pouze znaky, které si zaslouží pozornost. Možnost „rozložit složené emoji“ rozdělí sekvence postavené z několika kódových bodů — příznaky, rodinné emoji, varianty s tónem kůže — na jejich základní stavební prvky namísto zobrazení celé sekvence jako jedného řádku; běžná písmena s diakritikou zůstanou pohromadě, protože by to byl jen šum.

Názvy znaků pocházejí z velkého vestavěného tabulky pokrývající ASCII, latinské znaky s diakritikou (postavené na základě stejného pravidla základní písmeno plus diakritika, které používá samotný Unicode), cyrilici, řečtinu, běžné symboly, ideogramy CJK a slabiky Hangul — není to kopie úplné databáze s přibližně 150 000 položkami s názvy Unicode, která by byla příliš velká na odeslání do karty prohlížeče. Vzácné nebo nepřiřazené kódové body se vrátí na popis založený na bloku místo hádání a níže uvedené FAQ přesně ukazuje, kde je hranice.

Vše běží lokálně ve vašem prohlížeči: text, který kontrolujete, včetně hesel, soukromých poznámek nebo čehokoliv jiného, co byste neodeslali na náhodný webový formulář, se nikdy nikam neposílá. Zkopírujte výsledek, stáhněte si jej jako soubor .txt nebo jej pošlete přímo do jiného nástroje.

Časté dotazy

Proč se emoji někdy zobrazuje jako několik řádků?
Emoji jako příznaky, skupiny rodin nebo varianty s tónem kůže jsou často postaveny z více kódových bodů Unicode spojených dohromady. Nástroj je standardně zobrazuje jako jeden znak; zapněte možnost „rozložit složené emoji“ a uvidíte jednotlivé kódové body, které je tvoří.
Co zde znamená "blok"?
Blok Unicode je pojmenovaný rozsah kódových bodů, jako je „Basic Latin“ nebo „Cyrillic“. Seskupuje znaky podle toho, kde se nacházejí v normě Unicode, což se liší od jejich obecné kategorie (písmeno, interpunkce, symbol atd.).
Jsou názvy znaků vždy oficiálním názvem Unicode?
Pro ASCII, běžné latinské znaky s diakritikou, cyrilici, řečtinu, ideogramy CJK, slabiky Hangul a Wide sadu běžných symbolů a emoji ano. Pro vzácnější kódové body nástroj zobrazuje popisný fallback na základě bloku namísto hádání přesného názvu — úplná oficiální databáze názvů má přibližně 150 000 položek a nevejde se na stránku odeslané do vašeho prohlížeče.
Jak se určuje směr textu?
Je to zjednodušená kontrola, ne úplný algoritmus Unicode obousměrného textu: písmena ze skriptů zprava doleva (arabština, hebrejština a podobně) jsou označena jako „rtl“, ostatní písmena a číslice jsou označeny jako „ltr“ a interpunkce, symboly a mezery jsou označeny jako „neutral“.
Je můj text někam odeslán?
Ne. Každý znak je kontrolován zcela ve vašem prohlížeči — nic, co sem vložíte, se neposílá na server.