Blokken Unicode
Unicode verdeelt zijn codespace in benoemde blokken, elk een aaneengesloten bereik gereserveerd voor één script of één familie van symbolen. Weten welk blok een teken in leeft, verandert een mysterie — waarom brak deze plakactie, waarom mist deze regex het — in een beantwoordbare vraag.
De bloknamen zijn identifiers, geen beschrijvingen: zij worden letterlijk gebruikt in een regex als \p{Block=Cyrillic} en in elk Unicode-databestand, dus ze blijven in het Engels in elke taal. Wat wordt vertaald, is de zin ernaast.
Dit is een gemaakte selectie in plaats van alle ongeveer 340 blokken — de blokken die opduiken bij het werken met tekst. De ASCII-tabel dekt het eerste blok volledig in detail; deze pagina begint waar die stopt.
Latijn
5Latijn is verspreid over verschillende blokken, daarom werkt het matchen ervan per blok nooit helemaal.
| Bereik | Blok | Wat zit erin | Voorbeeld |
|---|---|---|---|
| U+0000–U+007F | Basic Latin | ASCII, onveranderd: Latijnse letters, cijfers, interpunctie, controle codes | A z 0 ? |
| U+0080–U+00FF | Latin-1 Supplement | Westeuropese accenten, plus £ § × ÷ en de onbrekbare spatie | é ñ ü × |
| U+0100–U+017F | Latin Extended-A | Centraal- en Oost-Europese accenten — č, ł, ő, ș | č ł ő š |
| U+0180–U+024F | Latin Extended-B | Extra letters voor Afrikaanse en fonetische orthografieën | ƒ ǎ ȳ |
| U+1E00–U+1EFF | Latin Extended Additional | Vietnamees en ander multi-geaccentueerd Latijn letters | ạ ế ṛ |
Combinatietekens en modificators
4Deze hechten aan het teken ervoor en hebben geen breedte.
| Bereik | Blok | Wat zit erin | Voorbeeld |
|---|---|---|---|
| U+0300–U+036F | Combining Diacritical Marks | Accenten toegepast op het voorgaande tekenDe tweede, ontlede manier om é te schrijven. Normaliseer naar NFC om het in te storten. | ◌́ ◌̈ ◌̌ |
| U+02B0–U+02FF | Spacing Modifier Letters | Superscript-letters en IPA-stress en toonmarkeringen | ʰ ˈ ˚ |
| U+FE00–U+FE0F | Variation Selectors | Onzichtbare kiezers die tekst of emoji-presentatie kiezen.VS16 is wat ✔ in een emoji verandert. Onzichtbaar, maar het telt. | |
| U+FE20–U+FE2F | Combining Half Marks | Helften van markeringen die twee teken omvatten |
Andere scripts
8| Bereik | Blok | Wat zit erin | Voorbeeld |
|---|---|---|---|
| U+0370–U+03FF | Greek and Coptic | Grieks, en de Koptische letters die zijn blok delen | α Ω π |
| U+0400–U+04FF | Cyrillic | Russisch, Oekraïens, Servisch, Bulgaars en verwante alfabetten | д Я ж |
| U+0590–U+05FF | Hebrew | Hebreeuwse letters, klinktekens en kantillatie-markeringen | א ש |
| U+0600–U+06FF | Arabic | Arabische letters, in hun geïsoleerde vormen | ا ب ي |
| U+0900–U+097F | Devanagari | Hindi, Sanskrit, Marathi en verwante talen | क ह |
| U+0E00–U+0E7F | Thai | Thaise medeklinkers, klinken en toonmarkeringen | ก ท |
| U+10A0–U+10FF | Georgian | Georgische Mkhedruli | ა ბ |
| U+1F00–U+1FFF | Greek Extended | Polytonic Grieks — de accenten van klassieke teksten | ᾰ ῶ |
De bron van de meeste onzichtbare teken die een copy-paste overleven.
5De bron van de meeste onzichtbare teken die een copy-paste overleven.
| Bereik | Blok | Wat zit erin | Voorbeeld |
|---|---|---|---|
| U+2000–U+206F | General Punctuation | Dashes, krulhaken, ellipsis — en de meeste onzichtbare spaties.U+200B zero-width space en U+2060 word joiner wonen hier. | – — “ ” … |
| U+2070–U+209F | Superscripts and Subscripts | Superscript en subscript cijfers en letters | ⁰ ⁴ ₂ |
| U+20A0–U+20CF | Currency Symbols | Valutastekens Latijn-1 heeft geen ruimte voor — €, ₴, ₹, ₺ | € ₴ ₺ |
| U+2100–U+214F | Letterlike Symbols | Symbolen gebouwd uit letters — ™, №, ℃, ℓ | ™ ℃ № |
| U+2150–U+218F | Number Forms | Vulgaire breuken en Romeinse cijfers als aparte teken | ⅓ ⅕ Ⅷ |
CJK en volledig breed
9| Bereik | Blok | Wat zit erin | Voorbeeld |
|---|---|---|---|
| U+2190–U+21FF | Arrows | Pijlen in elke richting, enkel en dubbel | ← ↔ ⇒ |
| U+2200–U+22FF | Mathematical Operators | Wiskundige operatoren — ∀, ∑, ≠, ∞ | ∀ ∑ ≠ |
| U+2300–U+23FF | Miscellaneous Technical | Toetsenbord en technische symbolen — ⌘, ⌥, ⌫, ⏎ | ⌘ ⌥ ⏎ |
| U+2500–U+257F | Box Drawing | Lijnen en hoeken voor terminaalboxen en tabellen | ─ ┌ ╬ |
| U+2580–U+259F | Block Elements | Volledige en gearceerde blokken, gebruikt voor terminal staafdiagrammen. | █ ▓ ░ |
| U+25A0–U+25FF | Geometric Shapes | Vierkanten, cirkels, driehoeken en diamanten | ■ ● ▲ |
| U+2600–U+26FF | Miscellaneous Symbols | Weer, astrologie, schaken, kaarten en de kaartpakken. | ☀ ★ ♥ |
| U+2700–U+27BF | Dingbats | Drukker's versieringen — vinkjes, scharen, sterren. | ✂ ✓ ➜ |
| U+2800–U+28FF | Braille Patterns | Alle 256 Braille-puntpatronen, ook gebruikt voor terminalafbeeldingen. | ⠁ ⣿ |
CJK en volledige breedte
6Volledig breed formulieren zijn aparte teken van hun ASCII-tweelingen, geen lettertype.
| Bereik | Blok | Wat zit erin | Voorbeeld |
|---|---|---|---|
| U+3000–U+303F | CJK Symbols and Punctuation | Ideografische spatie en CJK-interpunctie.U+3000 is een volledig-brede spatie en wordt niet bijgesneden door de meeste witruimteregels. | 、 。 |
| U+3040–U+309F | Hiragana | De Japanse lettergreepmarkt voor inheemse woorden en grammatica. | あ ん |
| U+30A0–U+30FF | Katakana | De Japanse lettergreepmarkt voor leenwoorden en nadruk. | ア ン |
| U+4E00–U+9FFF | CJK Unified Ideographs | Het belangrijkste Han-blok — bijna 21.000 teken gedeeld door Chinees, Japans en Koreaans. | 日 本 語 |
| U+AC00–U+D7AF | Hangul Syllables | Alle 11.172 voorgebouwde Koreaanse lettergrepen.Elk kan ook als aparte Jamo worden geschreven, wat normalisatie verzoent. | 한 글 |
| U+FF00–U+FFEF | Halfwidth and Fullwidth Forms | Volledig-brede kopieën van ASCII, en half-brede Katakana.A is niet A. Tekst geplakt uit CJK-formulieren moet vaak naar ASCII worden gevouwen. | A ! ア |
Boven U+FFFF, en de speciale gevallen
10Alles hier vergt twee UTF-16-eenheden, wat waar string-length bugs vandaan komen.
| Bereik | Blok | Wat zit erin | Voorbeeld |
|---|---|---|---|
| U+D800–U+DB7F | High Surrogates | Eerste helft van een UTF-16-paar — nooit geldig op zichzelf.Een lone surrogate is wat een tekenreeks door een emoji snijdt achter. | |
| U+DC00–U+DFFF | Low Surrogates | Tweede helft van een UTF-16-paar — nooit geldig op zichzelf. | |
| U+E000–U+F8FF | Private Use Area | Niet toegewezen per ontwerp, voor persoonlijke afspraken.Waar pictogrammen hun gliefen plaatsen. Zinloos zonder het bijpassende lettertype. | |
| U+FFF0–U+FFFF | Specials | Het vervangingsteken en de byte-order-markeringen verwanten.U+FFFD is wat je ziet wanneer een decoder het gaf op een byte. | � |
| U+1D400–U+1D7FF | Mathematical Alphanumeric Symbols | Vet, cursief, script en dubbel-slag alfabetten als teken.De bron van 𝐟𝐚𝐤𝐞 𝐛𝐨𝐥𝐝 in sociaalemediumnamen. Niet doorzoekbaar. | 𝐀 𝓪 𝟙 |
| U+1F300–U+1F5FF | Miscellaneous Symbols and Pictographs | Meeste niet-gezicht emoji — weer, objecten, plaatsen, symbolen. | 🌍 🔥 📄 |
| U+1F600–U+1F64F | Emoticons | De gezicht emoji. | 😀 🙂 |
| U+1F680–U+1F6FF | Transport and Map Symbols | Voertuigen, verkeer en kaartsymbolen. | 🚀 🛑 |
| U+1F900–U+1F9FF | Supplemental Symbols and Pictographs | Latere emoji-toevoegingen — latere gezichten, gebaren, objecten. | 🤖 🧠 |
| U+E0000–U+E007F | Tags | Onzichtbare tag-teken, gebruikt in vlagsequenties.Ook de vector voor onzichtbare tekst die in een normaal uitzien string is verborgen. |