Ugrás a tartalomhoz
100% helyi

Unicode karakterinspektor

Szöveg karakterekre bontása és az egyes karakterek kódpontjának, nevének, blokkjának, kategóriájának és méretének megtekintése.

Bemenet
Kimenet

Unicode karakterinspektor

Illessz be bármilyen szöveget, és ez az eszköz egyedi karakterekre bontja, megjelenítve mindegyikhez a kódpontját (U+XXXX), egy olvasható nevet, Unicode blokkját, általános kategóriáját (betű, jel, írásjelzés, szimbólum, elválasztó vagy vezérlőkarakter), szövegirányt és UTF-8 bájt-méretét. Az eszköz azokra a pillanatokra készült, amikor a szöveg jól néz ki, de váratlanul viselkedik — egy „okos idézőjel” ami megtöri a JSON elemzőt, egy nulla szélességű szóköz egy weblapról, vagy egy emodzsi amely több kódpontból ragasztott össze.

Kapcsold be az „azonos karakterek egyesítése” lehetőséget az ismétlések egy sorba csoportosításához előfordulási számmal — ez a leggyorsabb módja annak, hogy megválaszold: „milyen karakterek jelennek meg valójában ebben a fájlban és milyen gyakran”. A „csak ASCII-n kívüli karakterek” lehetőség elrejti az A-Z betűket, számjegyeket és alapvető írásjelzéseket, így csak figyelemre méltó karakterek jelennek meg. A „összetett emodzsikat szétbont” lehetőség több kódpontból felépített sorozatokat — zászlókat, családi emodzisokatat, bőrtónusos változatokat — nyers építőelemekre bontja; a közönséges diakritikussal rendelkező betűk együtt maradnak. Válassz közönséges táblázatot a képernyőn való olvasáshoz vagy CSV-t a táblázatkezelőbe ragasztáshoz.

A karakternevek egy nagy beépített táblázatból származnak, amely az ASCII-t, a diakritikussal rendelkező latin betűket, cirillt, görögöt, általános szimbólumokat, CJK ideogramokat és Hangul szótagokat fedez — nem az ~150.000 Unicode nevet tartalmazó teljes adatbázis másolata. A ritka vagy hozzárendeletlen kódpontok blokkalapú leírásra esnek vissza a kitalálás helyett, és az alábbi GYIK pontosan jelzi, hogy hol van a határ.

Mindez helyileg fut a böngésződben: az általad vizsgált szöveg, beleértve jelszavakat és személyes megjegyzéseket, soha nem kerül fel sehová. Másold ki az eredményt, töltsd le .txt fájlként, vagy küld egyenesen egy másik eszközbe.

Gyakori kérdések

Miért jelenik meg az emodzsi néha több sorként?
Az olyan emodziik, mint a zászlók, családi csoportok vagy bőrtónusos változatok gyakran több Unicode kódpontból ragasztódnak össze. Alapértelmezés szerint az eszköz egy karakterként mutatja őket; kapcsold be az „összetett emodzikat szétbont” lehetőséget az őket felépítő egyedi kódpontok megtekintéséhez.
Mit jelent a „blokk” itt?
Az Unicode blokk a kódpontok egy megnevezett tartománya, például a „Basic Latin” vagy a „Cyrillic”. A karaktereket aszerint csoportosítja, hogy hol helyezkednek el az Unicode szabványban, ami eltér az általános kategóriájuktól (betű, írásjelzés, szimbólum stb.).
A karakterneveik mindig az Unicode hivatalos nev?
Az ASCII-hoz, gyakori diakritikussal rendelkező latin betűkhöz, cirilához, görögökhöz, CJK ideogramokhoz, Hangul szótagokhoz és számos gyakori szimbólumhoz és emodzsihoz igen. A ritkább kódpontoknál az eszköz blokkalapú leírást mutat a pontos név kitalálása helyett — a teljes hivatalos névadatbázis körülbelül 150.000 bejegyzést tartalmaz és nem fér el a böngésződbe küldött lapon.
Hogyan határozható meg a szöveg iránya?
Ez egy egyszerűsített ellenőrzés, nem a teljes Unicode kétirányú algoritmus: a jobbról balra írásrendszerek betűi (arab, héber és hasonlók) „rtl” jelölésűek, az egyéb betűk és számjegyek „ltr” jelölésűek, az írásjelzés, szimbólumok és szóközök pedig „neutral” jelölésűek.
Feltöltésre kerül a szövegem valahova?
Nem. Mindegyik karakter teljes egészében a böngésződben kerül vizsgálatra — semmi, amit itt beillesz, nem kerül szerverre.