Blocchi Unicode
Unicode divide il suo spazio di codice in blocchi denominati, ognuno un intervallo contiguo riservato a uno script o una famiglia di simboli. Sapere in quale blocco vive un carattere è ciò che trasforma un mistero — perché ha incollato questo pausa, perché questo regex lo manca — in una domanda rispondibile.
I nomi dei blocchi sono identificatori, non descrizioni: sono usati letteralmente in un regex come \p{Block=Cyrillic} e in ogni file di dati Unicode, quindi rimangono in inglese in ogni lingua. Ciò che è tradotto è la frase accanto a loro.
Questa è una selezione curata piuttosto che tutti i circa 340 blocchi — quelli che si presentano quando si lavora con il testo. La tabella ASCII copre il primo blocco in dettaglio completo; questa pagina inizia dove quella si ferma.
Latino
5Il latino si diffonde su diversi blocchi, ecco perché abbinarlo per blocco non funziona mai bene.
| Intervallo | Blocco | Che cosa c'è dentro | Esempio |
|---|---|---|---|
| U+0000–U+007F | Basic Latin | ASCII, invariato: lettere latine, cifre, punteggiatura, codici di controllo | A z 0 ? |
| U+0080–U+00FF | Latin-1 Supplement | Accenti dell'Europa occidentale, più £ § × ÷ e lo spazio non-breaking | é ñ ü × |
| U+0100–U+017F | Latin Extended-A | Accenti dell'Europa centrale e orientale — č, ł, ő, ș | č ł ő š |
| U+0180–U+024F | Latin Extended-B | Lettere aggiuntive per le ortografie africane e fonetiche | ƒ ǎ ȳ |
| U+1E00–U+1EFF | Latin Extended Additional | Vietnamita e altre lettere latine multi-accentate | ạ ế ṛ |
Segni e modificatori combinanti
4Questi si allegano al carattere prima di loro e non hanno larghezza propria.
| Intervallo | Blocco | Che cosa c'è dentro | Esempio |
|---|---|---|---|
| U+0300–U+036F | Combining Diacritical Marks | Accenti applicati al carattere precedenteIl secondo, modo scomposto di scrivere é. Normalizzare a NFC per comprimerlo. | ◌́ ◌̈ ◌̌ |
| U+02B0–U+02FF | Spacing Modifier Letters | Lettere in apice e IPA stress e segni di tono | ʰ ˈ ˚ |
| U+FE00–U+FE0F | Variation Selectors | Selettori invisibili che scelgono testo o presentazione emojiVS16 è ciò che trasforma ✔ in un emoji. Invisibile, ma conta. | |
| U+FE20–U+FE2F | Combining Half Marks | Metà di segni che si estendono su due caratteri |
Altri script
8| Intervallo | Blocco | Che cosa c'è dentro | Esempio |
|---|---|---|---|
| U+0370–U+03FF | Greek and Coptic | Greco, e le lettere copte che condividono il suo blocco | α Ω π |
| U+0400–U+04FF | Cyrillic | Russo, ucraino, serbo, bulgaro e alfabeti correlati | д Я ж |
| U+0590–U+05FF | Hebrew | Lettere ebraiche, punti vocali e segni di cantillazione | א ש |
| U+0600–U+06FF | Arabic | Lettere arabe, nelle loro forme isolate | ا ب ي |
| U+0900–U+097F | Devanagari | Hindi, sanscrito, marathi e lingue correlate | क ह |
| U+0E00–U+0E7F | Thai | Consonanti thai, vocali e segni di tono | ก ท |
| U+10A0–U+10FF | Georgian | Mkhedruli georgiano | ა ბ |
| U+1F00–U+1FFF | Greek Extended | Greco politonico — gli accenti dei testi classici | ᾰ ῶ |
Punteggiatura e numeri
5La fonte della maggior parte dei caratteri invisibili che sopravvivono a una copia-incolla.
| Intervallo | Blocco | Che cosa c'è dentro | Esempio |
|---|---|---|---|
| U+2000–U+206F | General Punctuation | Trattini, virgolette ricci, ellissi — e la maggior parte degli spazi invisibiliU+200B spazio a larghezza zero e U+2060 word joiner vivono qui. | – — “ ” … |
| U+2070–U+209F | Superscripts and Subscripts | Cifre e lettere in apice e pedice | ⁰ ⁴ ₂ |
| U+20A0–U+20CF | Currency Symbols | Simboli di valuta che Latin-1 non ha spazio per — €, ₴, ₹, ₺ | € ₴ ₺ |
| U+2100–U+214F | Letterlike Symbols | Simboli costruiti da lettere — ™, №, ℃, ℓ | ™ ℃ № |
| U+2150–U+218F | Number Forms | Frazioni volgari e numeri romani come caratteri singoli | ⅓ ⅕ Ⅷ |
Simboli e disegno
9| Intervallo | Blocco | Che cosa c'è dentro | Esempio |
|---|---|---|---|
| U+2190–U+21FF | Arrows | Frecce in ogni direzione, singola e doppia | ← ↔ ⇒ |
| U+2200–U+22FF | Mathematical Operators | Operatori matematici — ∀, ∑, ≠, ∞ | ∀ ∑ ≠ |
| U+2300–U+23FF | Miscellaneous Technical | Simboli di tastiera e tecnici — ⌘, ⌥, ⌫, ⏎ | ⌘ ⌥ ⏎ |
| U+2500–U+257F | Box Drawing | Linee e angoli per caselle terminali e tabelle | ─ ┌ ╬ |
| U+2580–U+259F | Block Elements | Blocchi solidi e ombreggiati, utilizzati per grafici a barre terminali | █ ▓ ░ |
| U+25A0–U+25FF | Geometric Shapes | Quadrati, cerchi, triangoli e diamanti | ■ ● ▲ |
| U+2600–U+26FF | Miscellaneous Symbols | Meteo, astrologia, scacchi, carte e i semi delle carte | ☀ ★ ♥ |
| U+2700–U+27BF | Dingbats | Ornamenti del tipografo — segni di spunta, forbici, stelle | ✂ ✓ ➜ |
| U+2800–U+28FF | Braille Patterns | Tutti i 256 modelli di punti Braille, utilizzati anche per la grafica terminale | ⠁ ⣿ |
CJK e a larghezza intera
6Le forme a larghezza intera sono caratteri separati dai loro gemelli ASCII, non un font.
| Intervallo | Blocco | Che cosa c'è dentro | Esempio |
|---|---|---|---|
| U+3000–U+303F | CJK Symbols and Punctuation | Spazio ideografico e punteggiatura CJKU+3000 è uno spazio a larghezza intera e non viene tagliato dalla maggior parte delle regole di spazio. | 、 。 |
| U+3040–U+309F | Hiragana | La sillabario giapponese per parole native e grammatica | あ ん |
| U+30A0–U+30FF | Katakana | La sillabario giapponese per prestiti e enfasi | ア ン |
| U+4E00–U+9FFF | CJK Unified Ideographs | Il blocco Han principale — quasi 21.000 caratteri condivisi da cinese, giapponese e coreano | 日 本 語 |
| U+AC00–U+D7AF | Hangul Syllables | Tutti gli 11.172 sillabi coreani precompostiOgni uno può anche essere scritto come Jamo separato, che la normalizzazione riconcilia. | 한 글 |
| U+FF00–U+FFEF | Halfwidth and Fullwidth Forms | Copie a larghezza intera di ASCII e Katakana a mezza larghezzaA non è A. Il testo incollato dai moduli CJK spesso ha bisogno di essere piegato in ASCII. | A ! ア |
Sopra U+FFFF, e i casi speciali
10Qualsiasi cosa qui richiede due unità UTF-16, che è da dove provengono i bug di lunghezza della stringa.
| Intervallo | Blocco | Che cosa c'è dentro | Esempio |
|---|---|---|---|
| U+D800–U+DB7F | High Surrogates | Prima metà di una coppia UTF-16 — mai valida da solaUn surrogato solo è ciò che una stringa tagliata attraverso un emoji lascia alle spalle. | |
| U+DC00–U+DFFF | Low Surrogates | Seconda metà di una coppia UTF-16 — mai valida da sola | |
| U+E000–U+F8FF | Private Use Area | Non assegnato da progettazione, per accordi privatiDove i font icon mettono i loro glifi. Senza significato senza il font corrispondente. | |
| U+FFF0–U+FFFF | Specials | Il carattere di sostituzione e i relativi dell'ordine di byteU+FFFD è quello che vedi quando un decoder ha rinunciato a un byte. | � |
| U+1D400–U+1D7FF | Mathematical Alphanumeric Symbols | Alfabeti grassetto, corsivo, script e doppio colpo come caratteriLa fonte di 𝐟𝐚𝐤𝐞 𝐛𝐨𝐥𝐝 nei nomi dei social media. Non ricercabile. | 𝐀 𝓪 𝟙 |
| U+1F300–U+1F5FF | Miscellaneous Symbols and Pictographs | La maggior parte delle emoji non-faccia — meteo, oggetti, luoghi, simboli | 🌍 🔥 📄 |
| U+1F600–U+1F64F | Emoticons | L'emoji della faccia | 😀 🙂 |
| U+1F680–U+1F6FF | Transport and Map Symbols | Veicoli, traffico e simboli di mappa | 🚀 🛑 |
| U+1F900–U+1F9FF | Supplemental Symbols and Pictographs | Aggiunte successive di emoji — facce successive, gesti, oggetti | 🤖 🧠 |
| U+E0000–U+E007F | Tags | Caratteri tag invisibili, utilizzati in sequenze di flagAnche il vettore per il testo invisibile contrabbandato all'interno di una stringa apparentemente normale. |