İçeriğe atla
%100 yerel

Unicode Karakter İnceleme Aracı

Metni bireysel karakterlere böl ve her birinin kod noktasını, adını, bloğunu, kategorisini ve boyutunu gör.

Giriş
Çıkış

Unicode Karakter İnceleme Aracı

Herhangi bir metni yapıştır ve bu araç bunu bireysel karakterlere bölerek her birinin kod noktasını (U+XXXX), okunabilir adını, Unicode bloğunu, genel kategorisini (harf, işaret, noktalama, sembol, ayırıcı veya kontrol karakteri), yaklaşık metin yönünü ve UTF-8 kodlamasında kaç bayt kapladığını gösterir. Araç, metni düzgün görünüyor ancak beklenmedik şekilde davranıyor olduğu zamanlar için tasarlanmıştır — bir JSON ayrıştırıcıyı bozan "akıllı tırnak", bir web sayfasından kopyalanan yanlışlıkla boş genişlikte bir boşluk, bir alan adında gizli bir homoglif veya birden fazla kod noktasından yapıştırılmış bir emoji.

"Aynı karakterleri birleştir" seçeneğini açarak tekrarları her benzersiz karakter başına bir satıra birleştir ve oluşum sayısını göster — "bu dosyada hangi karakterler gerçekten görülür ve ne sıklıkta?" sorusunu yanıtlamanın en hızlı yolu. "Yalnızca ASCII olmayan karakterler" seçeneği normal A-Z harfleri, rakamları ve temel noktalamayı gizleyerek uzun bir belge yalnızca dikkat çeken karakterleri gösterir. "Bileşik emojileri çöz" seçeneği birden fazla kod noktasından oluşturulan dizileri — bayraklar, aile emojileri, cilt tonu değişkenleri — tüm diziyi tek bir satır olarak listelemek yerine ham yapı taşlarına böler; adi aksentli harfler yine de birlikte kalır çünkü bu sadece gürültü olur. Ekranda okumak için sade bir tablo veya elektronik tabloya yapıştırmak için CSV seçin.

Karakter adları ASCII, aksanlı Latin harfleri (Unicode'un kendisinin kullandığı taban-harf-artı-diyakritik kuralı kullanılarak oluşturulmuş), Kiril, Yunanca, yaygın semboller, CJK ideogramları ve Hangul hece tarafından kapsanan büyük bir yerleşik tablodan gelir — tümü tarafından kapsamadığı ~150.000 Unicode adından oluşan tam veritabanının bir kopyası değildir tarayıcı sekmesine göndermek için çok büyük olur. Nadir veya atanmamış kod noktaları tahmin etmek yerine blok tabanlı bir açıklamaya geri döner ve aşağıdaki SSS sınırın tam olarak nerede olduğunu gösterir.

Her şey tarayıcında yerel olarak çalışır: incelediğin metin, parolalar, özel notlar veya rastgele bir web formuna yapıştırmayacağın başka bir şey dahil olmak üzere, hiçbir yere yüklenmez. Sonucu kopyala, bir .txt dosyası olarak indir veya doğrudan başka bir araca gönder.

FAQ

Emoji neden bazen birden fazla satır olarak görünür?
Bayraklar, aile grupları veya cilt tonu değişkenleri gibi emojiler sıklıkla birden fazla Unicode kod noktasından yapıştırılır. Varsayılan olarak, araç bunları tek bir karakter olarak gösterir; "bileşik emojileri çöz" seçeneğini açarak bunları oluşturan bireysel kod noktalarını görebilirsin.
"Blok" burada ne anlama geliyor?
Unicode bloğu, "Basic Latin" veya "Cyrillic" gibi kod noktalarının adlandırılmış bir aralığıdır. Karakterleri Unicode standardında nerede yaşadıklarına göre gruplandırır, bu da genel kategorilerinden (harf, noktalama, sembol vb.) farklıdır.
Karakter adları her zaman resmi Unicode adı mı?
ASCII, yaygın aksanlı Latin harfleri, Kiril, Yunanca, CJK ideogramları, Hangul heceler ve geniş bir yaygın sembol ve emoji seti için evet. Daha nadir kod noktaları için araç, tam adı tahmin etmek yerine blok tabanlı açıklayıcı bir geri düşüş gösterir — tam resmi ad veritabanı yaklaşık 150.000 giriş içerir ve tarayıcınıza gönderilen bir sayfaya sığmaz.
Metin yönü nasıl belirlenir?
Bu tam Unicode çift yönlü algoritması değil, basitleştirilmiş bir kontrol: sağdan sola yazılan alfabelerdeki harfler (Arapça, İbranice vb.) "rtl" olarak işaretlenir, diğer harfler ve rakamlar "ltr" olarak işaretlenir ve noktalama, semboller ve boşluklar "neutral" olarak işaretlenir.
Metnim bir yere yükleniyor mu?
Hayır. Her karakter tamamen tarayıcında incelenir — buraya yapıştırdığın hiçbir şey sunucuya gönderilmez.