Sări la conținut
Complet local

Inspector de caractere Unicode

Împărțiți textul în caractere individuale și vedeți punctul de cod, numele, blocul, categoria și dimensiunea fiecăruia.

Intrare

Inspector de caractere Unicode

Lipiți orice text și acest instrument îl împarte în caractere individuale, afișând pentru fiecare punctul de cod (U+XXXX), un nume ușor de citit, blocul Unicode, categoria generală (literă, semn, punctuație, simbol, separator sau control), o direcție textuală aproximativă și câți octeți ocupă în UTF-8. Instrumentul este conceput pentru acele momente când textul arată bine dar se comportă ciudat — o ghilimea inteligentă care strică un analizor JSON, un spațiu gol lipsit copiat dintr-o pagină web, un omograf ascuns într-un nume de domeniu, sau un emoji care de fapt este compus din mai multe puncte de cod lipite la un loc.

Activați «fuzionează caractere identice» pentru a uni repetițiile într-o singură linie per caracter distinct cu numărare de apariții, ceea ce este cel mai rapid mod de a răspunde la «ce caractere apar efectiv în acest fișier și cât de des?». «Doar caractere care nu sunt ASCII» ascunde A-Z, cifre și punctuație de bază, pentru ca un document lung să arate doar caracterele care merită atenție. «Descompune emoji compuse» împarte secvențe construite din mai multe puncte de cod — steaguri, emoji familiale, variante cu tonuri de piele — în componentele lor brute în loc să enumereze întreaga secvență ca o linie. Alegeți un tabel simplu pentru citire pe ecran sau CSV pentru a lipi într-o foaie de calcul.

Numele caracterelor provin dintr-un tabel mare încorporat care acoperă ASCII, litere latine cu diacritice (construite urmând aceeași regulă literă-bază-plus-diacritic pe care o folosește Unicode), chirilic, grec, simboluri comune, ideograme CJK și silabe Hangul — nu este o copie a bazei de date complete cu ~150.000 de nume Unicode, care ar fi prea mare pentru a fi trimisă într-o filă de browser. Punctele de cod rare sau neatribuite se reiau la o descriere bazată pe bloc în loc să ghicească, iar răspunsurile la întrebări frecvente de mai jos indică exact unde se află linia.

Tot se execută local în browserul dvs: textul pe care îl inspectați, inclusiv parole, note private sau orice altceva pe care nu l-ați lipi într-un formular web aleatoriu, nu este niciodată încărcat. Copiați rezultatul, descărcați ca fișier .txt sau trimiteți direct la un alt instrument.

FAQ

De ce un emoji uneori apare ca mai multe linii?
Emoji cum ar fi steaguri, grupuri familiale sau variante cu tonuri de piele sunt adesea construite din mai multe puncte de cod Unicode unite. În mod implicit, instrumentul le arată ca un singur caracter; activați «descompune emoji compuse» pentru a vedea punctele de cod individuale din care sunt alcătuite.
Ce înseamnă "bloc" aici?
Un bloc Unicode este un interval denumit de puncte de cod, cum ar fi "Latin de bază" sau "Chirilic". Grupează caracterele după locul în care se află în standardul Unicode, ceea ce diferă de categoria lor generală (literă, punctuație, simbol ș.a.m.d.).
Sunt numele caracterelor întotdeauna numele oficial Unicode?
Pentru ASCII, litere latine obișnuite cu diacritice, chirilic, grec, ideograme CJK, silabe Hangul și un set larg de simboluri și emoji comune, da. Pentru puncte de cod mai rare, instrumentul arată un fallback descriptiv bazat pe bloc în loc să ghicească un nume exact — baza de date completă de nume oficiale conține aproximativ 150.000 de intrări și nu se potrivește pe o pagină trimisă browserului dvs.
Cum se determină direcția textului?
Este o verificare simplificată, nu algoritmul unicode bidirectional complet: literele din scripturi de la dreapta la stânga (arabă, ebraică și similare) sunt marcate ca «rtl», alte litere și cifre sunt marcate ca «ltr», și punctuația, simbolurile și spațierea sunt marcate ca «neutral».
Textul meu este încărcat undeva?
Nu. Fiecare caracter este inspectat complet în browserul dvs — nimic din ceea ce lipiți aici nu este trimis la un server.