Bloques Unicode
Unicode divide su espacio de código en bloques nombrados, cada uno un rango contiguo reservado para un script o una familia de símbolos. Saber en qué bloque vive un carácter es lo que convierte un misterio—¿por qué este pegado se rompió, por qué esta expresión regular lo pierde—en una pregunta que se puede responder.
Los nombres de los bloques son identificadores, no descripciones: se usan literalmente en una expresión regular como \p{Block=Cyrillic} e en cada archivo de datos Unicode, así que permanecen en inglés en cada idioma. Lo que se traduce es la oración junto a ellos.
Esta es una selección curada en lugar de todos los aproximadamente 340 bloques—los que aparecen al trabajar con texto. La tabla ASCII cubre el primer bloque en detalle completo; esta página comienza donde esa se detiene.
Latín
5El latín se distribuye sobre varios bloques, por eso hacer coincidir por bloque nunca funciona exactamente.
| Rango | Bloque | Qué contiene | Muestra |
|---|---|---|---|
| U+0000–U+007F | Basic Latin | ASCII, sin cambios: letras latinas, dígitos, puntuación, códigos de control | A z 0 ? |
| U+0080–U+00FF | Latin-1 Supplement | Acentos de Europa occidental, más £ § × ÷ e el espacio sin ruptura | é ñ ü × |
| U+0100–U+017F | Latin Extended-A | Acentos de Europa central e oriental—č, ł, ő, ș | č ł ő š |
| U+0180–U+024F | Latin Extended-B | Letras adicionales para ortografías africanas e fonéticas | ƒ ǎ ȳ |
| U+1E00–U+1EFF | Latin Extended Additional | Vietnamita e otras letras latinas con múltiples acentos | ạ ế ṛ |
Marcas combinables e modificadores
4Estos se adjuntan al carácter anterior e no tienen ancho propio.
| Rango | Bloque | Qué contiene | Muestra |
|---|---|---|---|
| U+0300–U+036F | Combining Diacritical Marks | Acentos aplicados al carácter anteriorLa segunda forma descompuesta para escribir é. Normaliza a NFC para colapsarlo. | ◌́ ◌̈ ◌̌ |
| U+02B0–U+02FF | Spacing Modifier Letters | Letras superíndice e marcas de énfasis e tono IPA | ʰ ˈ ˚ |
| U+FE00–U+FE0F | Variation Selectors | Selectores invisibles eligiendo presentación de texto o emojiVS16 es lo que convierte ✔ en un emoji. Invisible, pero cuenta. | |
| U+FE20–U+FE2F | Combining Half Marks | Mitades de marcas que abarcan dos caracteres |
Otros scripts
8| Rango | Bloque | Qué contiene | Muestra |
|---|---|---|---|
| U+0370–U+03FF | Greek and Coptic | Griego, e las letras coptas que comparten su bloque | α Ω π |
| U+0400–U+04FF | Cyrillic | Ruso, ucraniano, serbio, búlgaro e alfabetos relacionados | д Я ж |
| U+0590–U+05FF | Hebrew | Letras hebreas, puntos vocálicos e marcas de cantilación | א ש |
| U+0600–U+06FF | Arabic | Letras árabes, en sus formas aisladas | ا ب ي |
| U+0900–U+097F | Devanagari | Hindi, sánscrito, marathi e idiomas relacionados | क ह |
| U+0E00–U+0E7F | Thai | Consonantes tailandesas, vocales e marcas de tono | ก ท |
| U+10A0–U+10FF | Georgian | Mkhedruli georgiano | ა ბ |
| U+1F00–U+1FFF | Greek Extended | Griego politónico—los acentos de textos clásicos | ᾰ ῶ |
Puntuación e números
5La fuente de la mayoría de caracteres invisibles que sobreviven a una copia-pega.
| Rango | Bloque | Qué contiene | Muestra |
|---|---|---|---|
| U+2000–U+206F | General Punctuation | Guiones, comillas rizadas, puntos suspensivos—e la mayoría de espacios invisiblesU+200B espacio de ancho cero e U+2060 unidor de palabras viven aquí. | – — “ ” … |
| U+2070–U+209F | Superscripts and Subscripts | Dígitos e letras superíndice e subíndice | ⁰ ⁴ ₂ |
| U+20A0–U+20CF | Currency Symbols | Signos de moneda Latino-1 sin espacio para—€, ₴, ₹, ₺ | € ₴ ₺ |
| U+2100–U+214F | Letterlike Symbols | Símbolos construidos de letras—™, №, ℃, ℓ | ™ ℃ № |
| U+2150–U+218F | Number Forms | Fracciones vulgares e numerales romanos como caracteres únicos | ⅓ ⅕ Ⅷ |
Símbolos e dibujos
9| Rango | Bloque | Qué contiene | Muestra |
|---|---|---|---|
| U+2190–U+21FF | Arrows | Flechas en cada dirección, sencillas e dobles | ← ↔ ⇒ |
| U+2200–U+22FF | Mathematical Operators | Operadores matemáticos—∀, ∑, ≠, ∞ | ∀ ∑ ≠ |
| U+2300–U+23FF | Miscellaneous Technical | Símbolos técnicos e de teclado—⌘, ⌥, ⌫, ⏎ | ⌘ ⌥ ⏎ |
| U+2500–U+257F | Box Drawing | Líneas e esquinas para cajas de terminal e tablas | ─ ┌ ╬ |
| U+2580–U+259F | Block Elements | Bloques sólidos e sombreados, usados para gráficos de barras de terminal | █ ▓ ░ |
| U+25A0–U+25FF | Geometric Shapes | Cuadrados, círculos, triángulos e diamantes | ■ ● ▲ |
| U+2600–U+26FF | Miscellaneous Symbols | Clima, astrología, ajedrez, naipes e los palos de los naipes | ☀ ★ ♥ |
| U+2700–U+27BF | Dingbats | Adornos de imprenta—marcas de verificación, tijeras, estrellas | ✂ ✓ ➜ |
| U+2800–U+28FF | Braille Patterns | Todos los 256 patrones de puntos de Braille, usados para gráficos de terminal también | ⠁ ⣿ |
CJK e ancho completo
6Los formularios de ancho completo son caracteres separados de sus gemelos ASCII, no una fuente.
| Rango | Bloque | Qué contiene | Muestra |
|---|---|---|---|
| U+3000–U+303F | CJK Symbols and Punctuation | Espacio ideográfico e puntuación CJKU+3000 es un espacio de ancho completo e no se recorta por la mayoría de reglas de espacios en blanco. | 、 。 |
| U+3040–U+309F | Hiragana | La sílaba japonesa para palabras nativas e gramática | あ ん |
| U+30A0–U+30FF | Katakana | La sílaba japonesa para préstamos e énfasis | ア ン |
| U+4E00–U+9FFF | CJK Unified Ideographs | El bloque Han principal—casi 21,000 caracteres compartidos por chino, japonés e coreano | 日 本 語 |
| U+AC00–U+D7AF | Hangul Syllables | Las 11,172 sílabas coreanas precompuestasCada una también puede escribirse como Jamo separado, que la normalización reconcilia. | 한 글 |
| U+FF00–U+FFEF | Halfwidth and Fullwidth Forms | Copias de ancho completo de ASCII, e Katakana de ancho medioA no es A. El texto pegado de formularios CJK frecuentemente necesita ser plegado a ASCII. | A ! ア |
Arriba de U+FFFF, e los casos especiales
10Cualquier cosa aquí toma dos unidades UTF-16, que es de donde surgen los errores de longitud de cadena.
| Rango | Bloque | Qué contiene | Muestra |
|---|---|---|---|
| U+D800–U+DB7F | High Surrogates | Primera mitad de un par UTF-16—nunca válido por sí soloUn sustituto solitario es lo que una cadena cortada a través de un emoji deja atrás. | |
| U+DC00–U+DFFF | Low Surrogates | Segunda mitad de un par UTF-16—nunca válido por sí solo | |
| U+E000–U+F8FF | Private Use Area | Sin asignar por diseño, para acuerdos privadosDonde los iconos fuentes ponen sus glifos. Sin sentido sin la fuente coincidente. | |
| U+FFF0–U+FFFF | Specials | El carácter de reemplazo e los parientes de la marca de orden de byteU+FFFD es lo que ves cuando un decodificador se rindió en un byte. | � |
| U+1D400–U+1D7FF | Mathematical Alphanumeric Symbols | Alfabetos negrita, cursiva, script e doble ataque como caracteresLa fuente de 𝐟𝐚𝐤𝐞 𝐛𝐨𝐥𝐝 en nombres de redes sociales. Insearchable. | 𝐀 𝓪 𝟙 |
| U+1F300–U+1F5FF | Miscellaneous Symbols and Pictographs | Emoji que no son caras—clima, objetos, lugares, símbolos | 🌍 🔥 📄 |
| U+1F600–U+1F64F | Emoticons | El emoji de cara | 😀 🙂 |
| U+1F680–U+1F6FF | Transport and Map Symbols | Vehículos, símbolos de tráfico e mapa | 🚀 🛑 |
| U+1F900–U+1F9FF | Supplemental Symbols and Pictographs | Adiciones posteriores de emoji—caras posteriores, gestos, objetos | 🤖 🧠 |
| U+E0000–U+E007F | Tags | Caracteres de etiqueta invisibles, usados en secuencias de banderaTambién el vector para texto invisible contrabandado dentro de una cadena que se ve normal. |