Blocos Unicode
Unicode divide seu espaço de código em blocos nomeados, cada um um intervalo contíguo reservado para um script ou uma família de símbolos. Saber em qual bloco um caractere vive é o que transforma um mistério — por que esse paste quebrou, por que esse regex perde — em uma pergunta respondível.
Os nomes dos blocos são identificadores, não descrições: são usados literalmente em um regex como \p{Block=Cyrillic} e em todos os arquivos de dados Unicode, então eles permanecem em inglês em cada idioma. O que é traduzido é a frase ao lado deles.
Esta é uma seleção curada em vez de todos os aproximadamente 340 blocos — aqueles que aparecem ao trabalhar com texto. A tabela ASCII cobre o primeiro bloco em detalhes completos; esta página começa onde aquela para.
Latino
5Latin é distribuído em vários blocos, por isso corresponder a ele por bloco nunca funciona completamente.
| Intervalo | Bloco | O que está nele | Amostra |
|---|---|---|---|
| U+0000–U+007F | Basic Latin | ASCII, inalterado: letras latinas, dígitos, pontuação, códigos de controle | A z 0 ? |
| U+0080–U+00FF | Latin-1 Supplement | Acentos da Europa Ocidental, além de £ § × ÷ e o espaço não-quebrável | é ñ ü × |
| U+0100–U+017F | Latin Extended-A | Acentos da Europa Central e Oriental — č, ł, ő, ș | č ł ő š |
| U+0180–U+024F | Latin Extended-B | Letras adicionais para ortografias africanas e fonéticas | ƒ ǎ ȳ |
| U+1E00–U+1EFF | Latin Extended Additional | Vietnamita e outras letras latinas com múltiplos acentos | ạ ế ṛ |
Marcas e modificadores combinados
4Estes se anexam ao caractere antes deles e não têm largura própria.
| Intervalo | Bloco | O que está nele | Amostra |
|---|---|---|---|
| U+0300–U+036F | Combining Diacritical Marks | Acentos aplicados ao caractere anteriorA segunda forma, decomposta para escrever é. Normalizar para NFC para colapsá-lo. | ◌́ ◌̈ ◌̌ |
| U+02B0–U+02FF | Spacing Modifier Letters | Letras sobrescritas e marcas de stress e tom de IPA | ʰ ˈ ˚ |
| U+FE00–U+FE0F | Variation Selectors | Seletores invisíveis escolhendo apresentação de texto ou emojiVS16 é o que transforma ✔ em um emoji. Invisível, mas conta. | |
| U+FE20–U+FE2F | Combining Half Marks | Metades de marcas abrangendo dois caracteres |
Outros scripts
8| Intervalo | Bloco | O que está nele | Amostra |
|---|---|---|---|
| U+0370–U+03FF | Greek and Coptic | Grego, e as letras coptas que compartilham seu bloco | α Ω π |
| U+0400–U+04FF | Cyrillic | Russo, ucraniano, sérvio, búlgaro e alfabetos relacionados | д Я ж |
| U+0590–U+05FF | Hebrew | Letras hebraicas, pontos de vogais e marcas de cantilação | א ש |
| U+0600–U+06FF | Arabic | Letras árabes, em suas formas isoladas | ا ب ي |
| U+0900–U+097F | Devanagari | Hindi, sânscrito, Marathi e idiomas relacionados | क ह |
| U+0E00–U+0E7F | Thai | Consoantes tailandesas, vogais e marcas de tom | ก ท |
| U+10A0–U+10FF | Georgian | Georgian Mkhedruli | ა ბ |
| U+1F00–U+1FFF | Greek Extended | Grego politônico — os acentos de textos clássicos | ᾰ ῶ |
Pontuação e números
5A fonte da maioria dos caracteres invisíveis que sobrevivem a um colar-paste.
| Intervalo | Bloco | O que está nele | Amostra |
|---|---|---|---|
| U+2000–U+206F | General Punctuation | Travessões, aspas curvas, reticências — e espaços invisíveis maisU+200B zero-width space e U+2060 word joiner vivem aqui. | – — “ ” … |
| U+2070–U+209F | Superscripts and Subscripts | Dígitos e letras sobrescritos e subscritos | ⁰ ⁴ ₂ |
| U+20A0–U+20CF | Currency Symbols | Símbolos de moeda que Latin-1 não tem espaço para — €, ₴, ₹, ₺ | € ₴ ₺ |
| U+2100–U+214F | Letterlike Symbols | Símbolos construídos a partir de letras — ™, №, ℃, ℓ | ™ ℃ № |
| U+2150–U+218F | Number Forms | Frações vulgares e numerais romanos como caracteres únicos | ⅓ ⅕ Ⅷ |
Símbolos e desenho
9| Intervalo | Bloco | O que está nele | Amostra |
|---|---|---|---|
| U+2190–U+21FF | Arrows | Setas em todas as direções, simples e duplas | ← ↔ ⇒ |
| U+2200–U+22FF | Mathematical Operators | Operadores matemáticos — ∀, ∑, ≠, ∞ | ∀ ∑ ≠ |
| U+2300–U+23FF | Miscellaneous Technical | Símbolos de teclado e técnicos — ⌘, ⌥, ⌫, ⏎ | ⌘ ⌥ ⏎ |
| U+2500–U+257F | Box Drawing | Linhas e cantos para caixas de terminal e tabelas | ─ ┌ ╬ |
| U+2580–U+259F | Block Elements | Blocos sólidos e sombreados, usados para gráficos de barras de terminal | █ ▓ ░ |
| U+25A0–U+25FF | Geometric Shapes | Quadrados, círculos, triângulos e diamantes | ■ ● ▲ |
| U+2600–U+26FF | Miscellaneous Symbols | Clima, astrologia, xadrez, cartas e naipes | ☀ ★ ♥ |
| U+2700–U+27BF | Dingbats | Ornamentos de impressora — marcas de seleção, tesoura, estrelas | ✂ ✓ ➜ |
| U+2800–U+28FF | Braille Patterns | Todos os 256 padrões de pontos Braille, usados para gráficos de terminal também | ⠁ ⣿ |
CJK e largura completa
6As formas de largura completa são caracteres separados de seus gêmeos ASCII, não uma fonte.
| Intervalo | Bloco | O que está nele | Amostra |
|---|---|---|---|
| U+3000–U+303F | CJK Symbols and Punctuation | Espaço ideográfico e pontuação CJKU+3000 é um espaço de largura completa e não é aparado pela maioria das regras de espaço em branco. | 、 。 |
| U+3040–U+309F | Hiragana | O silabário japonês para palavras nativas e gramática | あ ん |
| U+30A0–U+30FF | Katakana | O silabário japonês para empréstimos e ênfase | ア ン |
| U+4E00–U+9FFF | CJK Unified Ideographs | O bloco Han principal — quase 21.000 caracteres compartilhados por chinês, japonês e coreano | 日 本 語 |
| U+AC00–U+D7AF | Hangul Syllables | Todas as 11.172 sílabas coreanas pré-compostasCada um também pode ser escrito como Jamo separado, que normalização reconcilia. | 한 글 |
| U+FF00–U+FFEF | Halfwidth and Fullwidth Forms | Cópias de largura completa de ASCII, e Katakana de meia larguraA não é A. Texto colado de formulários CJK frequentemente precisa dobrado para ASCII. | A ! ア |
Acima de U+FFFF, e os casos especiais
10Qualquer coisa aqui leva duas unidades UTF-16, que é de onde vêm os bugs de comprimento de string.
| Intervalo | Bloco | O que está nele | Amostra |
|---|---|---|---|
| U+D800–U+DB7F | High Surrogates | Primeira metade de um par UTF-16 — nunca válida sozinhaUm substituo solitário é o que uma string cortada através de um emoji deixa para trás. | |
| U+DC00–U+DFFF | Low Surrogates | Segunda metade de um par UTF-16 — nunca válida sozinha | |
| U+E000–U+F8FF | Private Use Area | Não atribuído por design, para acordos privadosOnde fontes de ícone colocam seus glifos. Sem sentido sem a fonte correspondente. | |
| U+FFF0–U+FFFF | Specials | O caractere de substituição e os parentes da marca de ordem de byteU+FFFD é o que você vê quando um decodificador desistiu. | � |
| U+1D400–U+1D7FF | Mathematical Alphanumeric Symbols | Alfabetos em negrito, itálico, script e double-struck como caracteresA fonte de 𝐟𝐚𝐤𝐞 𝐛𝐨𝐥𝐝 em nomes de mídia social. Não pesquisável. | 𝐀 𝓪 𝟙 |
| U+1F300–U+1F5FF | Miscellaneous Symbols and Pictographs | Maioria de emoji não-rosto — clima, objetos, lugares, símbolos | 🌍 🔥 📄 |
| U+1F600–U+1F64F | Emoticons | O emoji rosto | 😀 🙂 |
| U+1F680–U+1F6FF | Transport and Map Symbols | Veículos, tráfego e símbolos de mapa | 🚀 🛑 |
| U+1F900–U+1F9FF | Supplemental Symbols and Pictographs | Adições posteriores de emoji — rostos posteriores, gestos, objetos | 🤖 🧠 |
| U+E0000–U+E007F | Tags | Caracteres de tag invisíveis, usados em sequências de bandeiraTambém o vetor para texto invisível contrabandendo dentro de uma string de aparência normal. |