Blocs Unicode
Unicode divise son espace de code en blocs nommés, chacun une plage contiguë réservée à un script ou une famille de symboles. Savoir dans quel bloc vit un caractère est ce qui transforme un mystère — pourquoi cette colle s'est cassée, pourquoi cette regex la manque — en une question répondable.
Les noms de bloc sont des identifiants, pas des descriptions : ils sont utilisés littéralement dans un regex comme \p{Block=Cyrillic} et dans chaque fichier de données Unicode, donc ils restent en anglais dans chaque langue. Ce qui est traduit est la phrase à côté d'eux.
C'est une sélection curée plutôt que tous les environ 340 blocs — ceux qui se présentent quand on travaille avec du texte. La table ASCII couvre le premier bloc en détail complet ; cette page commence où celle-ci s'arrête.
Latin
5Le latin est réparti sur plusieurs blocs, c'est pourquoi le faire correspondre par bloc ne fonctionne jamais vraiment.
| Gamme | Bloc | Qu'est-ce que c'est | Échantillon |
|---|---|---|---|
| U+0000–U+007F | Basic Latin | ASCII, inchangé : lettres latines, chiffres, ponctuation, codes de contrôle | A z 0 ? |
| U+0080–U+00FF | Latin-1 Supplement | Accents européens occidentaux, plus £ § × ÷ et l'espace insécable | é ñ ü × |
| U+0100–U+017F | Latin Extended-A | Accents d'Europe centrale et orientale — č, ł, ő, ș | č ł ő š |
| U+0180–U+024F | Latin Extended-B | Lettres supplémentaires pour les orthographes africaines et phonétiques | ƒ ǎ ȳ |
| U+1E00–U+1EFF | Latin Extended Additional | Vietnamien et autres lettres latines à plusieurs accents | ạ ế ṛ |
Marques combinatrices et modificateurs
4Ceux-ci s'attachent au caractère avant eux et n'ont pas de largeur propre.
| Gamme | Bloc | Qu'est-ce que c'est | Échantillon |
|---|---|---|---|
| U+0300–U+036F | Combining Diacritical Marks | Les accents appliqués au caractère précédentLa deuxième façon, décomposée d'écrire é. Normaliser en NFC pour le réduire. | ◌́ ◌̈ ◌̌ |
| U+02B0–U+02FF | Spacing Modifier Letters | Lettres en exposant et marques de stress et de ton IPA | ʰ ˈ ˚ |
| U+FE00–U+FE0F | Variation Selectors | Sélecteurs invisibles choisissant texte ou présentation emojiVS16 est ce qui transforme ✔ en emoji. Invisible, mais il compte. | |
| U+FE20–U+FE2F | Combining Half Marks | Moitiés de marques s'étendant sur deux caractères |
Autres scripts
8| Gamme | Bloc | Qu'est-ce que c'est | Échantillon |
|---|---|---|---|
| U+0370–U+03FF | Greek and Coptic | Grec, et les lettres coptes qui partagent son bloc | α Ω π |
| U+0400–U+04FF | Cyrillic | Russe, ukrainien, serbe, bulgare et alphabets connexes | д Я ж |
| U+0590–U+05FF | Hebrew | Lettres hébraïques, voyelles ponctuées et marques de cantillation | א ש |
| U+0600–U+06FF | Arabic | Lettres arabes, sous leurs formes isolées | ا ب ي |
| U+0900–U+097F | Devanagari | Hindi, sanskrit, marathi et langues connexes | क ह |
| U+0E00–U+0E7F | Thai | Consonnes thaïlandaises, voyelles et marques de ton | ก ท |
| U+10A0–U+10FF | Georgian | Mkhedruli géorgien | ა ბ |
| U+1F00–U+1FFF | Greek Extended | Grec polytone — les accents des textes classiques | ᾰ ῶ |
Ponctuation et nombres
5La source de la plupart des caractères invisibles qui survivent à une copie-colle.
| Gamme | Bloc | Qu'est-ce que c'est | Échantillon |
|---|---|---|---|
| U+2000–U+206F | General Punctuation | Tirets, guillemets bouclés, points de suspension — et la plupart des espaces invisiblesL'espace de largeur nulle U+200B et le joncteur de mot U+2060 vivent ici. | – — “ ” … |
| U+2070–U+209F | Superscripts and Subscripts | Chiffres et lettres en exposant et en indice | ⁰ ⁴ ₂ |
| U+20A0–U+20CF | Currency Symbols | Signes monétaires que Latin-1 n'a pas de place pour — €, ₴, ₹, ₺ | € ₴ ₺ |
| U+2100–U+214F | Letterlike Symbols | Symboles construits à partir de lettres — ™, №, ℃, ℓ | ™ ℃ № |
| U+2150–U+218F | Number Forms | Fractions vulgaires et chiffres romains en tant que caractères uniques | ⅓ ⅕ Ⅷ |
Symboles et dessin
9| Gamme | Bloc | Qu'est-ce que c'est | Échantillon |
|---|---|---|---|
| U+2190–U+21FF | Arrows | Flèches dans chaque direction, simple et double | ← ↔ ⇒ |
| U+2200–U+22FF | Mathematical Operators | Opérateurs mathématiques — ∀, ∑, ≠, ∞ | ∀ ∑ ≠ |
| U+2300–U+23FF | Miscellaneous Technical | Symboles de clavier et techniques — ⌘, ⌥, ⌫, ⏎ | ⌘ ⌥ ⏎ |
| U+2500–U+257F | Box Drawing | Lignes et coins pour les boîtes de terminal et les tableaux | ─ ┌ ╬ |
| U+2580–U+259F | Block Elements | Blocs solides et ombrés, utilisés pour les graphiques à barres de terminal | █ ▓ ░ |
| U+25A0–U+25FF | Geometric Shapes | Carrés, cercles, triangles et diamants | ■ ● ▲ |
| U+2600–U+26FF | Miscellaneous Symbols | Temps, astrologie, échecs, cartes et costumes de cartes | ☀ ★ ♥ |
| U+2700–U+27BF | Dingbats | Ornements de l'imprimerie — coches, ciseaux, étoiles | ✂ ✓ ➜ |
| U+2800–U+28FF | Braille Patterns | Les 256 motifs de points Braille, utilisés également pour les graphiques de terminal | ⠁ ⣿ |
CJK et largeur complète
6Les formes de largeur complète sont des caractères distincts de leurs jumeaux ASCII, pas une police.
| Gamme | Bloc | Qu'est-ce que c'est | Échantillon |
|---|---|---|---|
| U+3000–U+303F | CJK Symbols and Punctuation | Espace idéographique et ponctuation CJKU+3000 est un espace de largeur complète et n'est pas coupé par la plupart des règles d'espace blanc. | 、 。 |
| U+3040–U+309F | Hiragana | La syllabaire japonaise pour les mots natifs et la grammaire | あ ん |
| U+30A0–U+30FF | Katakana | La syllabaire japonaise pour les mots d'emprunt et l'emphase | ア ン |
| U+4E00–U+9FFF | CJK Unified Ideographs | Le bloc Han principal — près de 21 000 caractères partagés par le chinois, le japonais et le coréen | 日 本 語 |
| U+AC00–U+D7AF | Hangul Syllables | Les 11 172 syllabes coréennes précomposéesChacun peut également être écrit en tant que Jamo séparé, que la normalisation concilie. | 한 글 |
| U+FF00–U+FFEF | Halfwidth and Fullwidth Forms | Copies de largeur complète d'ASCII et demi-largeur KatakanaA n'est pas A. Le texte collé à partir des formes CJK doit souvent être replié en ASCII. | A ! ア |
Au-dessus de U+FFFF, et les cas spéciaux
10Tout ici prend deux unités UTF-16, c'est où viennent les bugs de longueur de chaîne.
| Gamme | Bloc | Qu'est-ce que c'est | Échantillon |
|---|---|---|---|
| U+D800–U+DB7F | High Surrogates | Première moitié d'une paire UTF-16 — jamais valide seuleUn remplaçant solitaire est ce qu'une chaîne coupée au milieu d'un emoji laisse derrière elle. | |
| U+DC00–U+DFFF | Low Surrogates | Deuxième moitié d'une paire UTF-16 — jamais valide seule | |
| U+E000–U+F8FF | Private Use Area | Non attribué par conception, pour les accords privésOù les polices d'icônes mettent leurs glyphes. Sans sens sans la police correspondante. | |
| U+FFF0–U+FFFF | Specials | Le caractère de remplacement et les parents de la marque d'ordre des octetsU+FFFD est ce que vous voyez quand un décodeur a renoncé à un octet. | � |
| U+1D400–U+1D7FF | Mathematical Alphanumeric Symbols | Alphabets gras, italiques, scriptés et double-frappés en tant que caractèresLa source de 𝐟𝐚𝐤𝐞 𝐛𝐨𝐥𝐝 dans les noms de médias sociaux. Insearchable. | 𝐀 𝓪 𝟙 |
| U+1F300–U+1F5FF | Miscellaneous Symbols and Pictographs | La plupart des emojis sans visage — météo, objets, places, symboles | 🌍 🔥 📄 |
| U+1F600–U+1F64F | Emoticons | L'emoji du visage | 😀 🙂 |
| U+1F680–U+1F6FF | Transport and Map Symbols | L'emoji du visage | 🚀 🛑 |
| U+1F900–U+1F9FF | Supplemental Symbols and Pictographs | Véhicules, circulation et symboles cartographiques | 🤖 🧠 |
| U+E0000–U+E007F | Tags | Ajouts emoji ultérieurs — faces ultérieures, gestes, objetsCaractères d'étiquette invisibles, utilisés dans les séquences d'indicateurs |