Hoppa till innehåll
100% lokalt

Unicode-teckeninspektor

Delar upp texten i enskilda tecken och visar kodpunkten, namnet, blocket, kategorin och storleken på varje tecken.

Inmatning
Utmatning

Unicode-teckeninspektor

Klistra in valfri text och det här verktyget delar upp den i enskilda tecken, vilket visar varje kodpunkt (U+XXXX), ett läsbart namn, Unicode-blocket, allmän kategori (bokstav, märke, interpunktion, symbol, separator eller kontrolltecken), ungefärlig textriktning och antal byte i UTF-8-kodning. Det är utformat för stunder när text ser bra ut men beter sig oväntat – ett "smartcitat" som bryter en JSON-parser, ett vilse noll-bredds-tecken kopierat från en webbsida, en homoglyf gömd i ett domännamn, eller en emoji som visar sig bestå av flera kodpunkter samlade tillsammans.

Slå på "Slå samman identiska tecken" för att slå samman upprepningar till en rad per distinkt tecken med en förekomsträkning – det snabbaste sättet att svara på "vilka tecken förekommer faktiskt i denna fil och hur ofta?". Med "Endast tecken utanför ASCII" döljs vanlig A-Z, siffror och grundläggande interpunktion, så ett långt dokument endast visar tecken som är värt att titta på. Med "Bryt ned sammansatta emoji" bryts sekvenser som är byggda från flera kodpunkter – flaggor, familjeemoji, hudtonfärgvarianter – ner till deras råa byggstenar istället för att visa hela sekvensen som en rad. Vanliga bokstäver med accenter förblir tillsammans, eftersom det bara skulle vara brus.

Teckennamn kommer från en stor inbyggd tabell som täcker ASCII, latinska bokstäver med diakritiska tecken (byggd enligt samma regel för basbokstav plus diakritik som Unicode själv använder), kyrilliska, grekiska, vanliga symboler, CJK-ideogram och Hangul-stavelser – inte en kopia av den fullständiga databasen med cirka 150 000 Unicode-namnsignaler som skulle vara för stor för att skicka till en webbläsarflik. Sällsynta eller otilldelade kodpunkter faller tillbaka på en blockbaserad beskrivning istället för att gissa, och de vanligaste frågorna nedan anger exakt var gränsen är.

Allt körs lokalt i din webbläsare: texten du inspekterar, inklusive lösenord, privata anteckningar eller något annat du inte skulle klistra in i ett slumpmässigt webbformulär, laddas aldrig upp någonstans. Kopiera resultatet, ladda ner det som en .txt-fil, eller skicka det direkt till ett annat verktyg.

FAQ

Varför visas en emoji ibland som flera rader?
Emoji som flaggor, familjegrupper eller hudtonfärgvarianter är ofta byggda från flera Unicode-kodpunkter samlade tillsammans. Verktyget visar dem som standard som ett tecken. Slå på "Bryt ned sammansatta emoji" för att se de enskilda kodpunkter som de är uppbyggda av.
Vad betyder "block" här?
Ett Unicode-block är ett namngivet intervall av kodpunkter, som "Basic Latin" eller "Cyrillic". Det grupperar tecken enligt var de finns i Unicode-standarden, vilket skiljer sig från deras allmänna kategori (bokstav, interpunktion, symbol och så vidare).
Är teckennamnen alltid det officiella Unicode-namnet?
För ASCII, vanliga latinska bokstäver med diakritiska tecken, kyrilliska, grekiska, CJK-ideogram, Hangul-stavelser och en bred uppsättning vanliga symboler och emoji, ja. För sällsyntare kodpunkter visar verktyget en beskrivande återgång baserad på blocket istället för att gissa ett exakt namn – den fullständiga officiella namnsdatabasen innehåller cirka 150 000 poster och passar inte på en sida som skickas till din webbläsare.
Hur bestäms textriktningen?
Det är en förenklad kontroll, inte den fullständiga Unicode-tvåvägsalgoritmen: bokstäver från höger-till-vänster-skript (arabiska, hebreiska och liknande) är markerade "rtl", andra bokstäver och siffror är markerade "ltr", och interpunktion, symboler och mellanrum är markerade "neutral".
Laddas min text upp någonstans?
Nej. Varje tecken inspekteras helt i din webbläsare – ingenting som du klistrar in här skickas till en server.