İçeriğe atla
%100 yerel

Karakter seti dedektörü

Bozuk metnin arkasındaki orijinal kodlamayı tahmin edin ve kurtarın.

Giriş
Çıkış

Karakter seti dedektörü

Metni, "PrĂliš" veya "GrĂ¶ĂŸe" gibi vurgulu harflerin dizelere dönüştüğü yerlere yapıştırın; bu araç neyin yanlış gittiğini tahmin eder. Bunun genel nedeni, tek baytlık bir kod sayfası olduğunu varsayan bir şey aracılığıyla açılan, kaydedilen veya iletilen bir UTF-8 dosyasıdır (Orta Avrupa metni için Windows-1250 veya ISO-8859-2, Batı Avrupa metni için Windows-1252). Her vurgulu karakter başlangıçta iki veya üç UTF-8 bayttan oluşuyordu; Yanlış kod sayfası altında her seferinde bir bayt okursanız, bunlar tam olarak bu türden çifte çöp haline gelir.

Algılayıcı, her aday kod sayfası için ters işlemi deneyerek ve sonucun iyi biçimlendirilmiş UTF-8 olup olmadığını kontrol ederek çalışır; bu, doğru kodlanmış metnin esasen hiçbir zaman tesadüfen geçemediği yapısal bir testtir; bu nedenle, otomatik algılama, yazı tura atmak yerine gerçek güvenle bir düzeltme uygulayabilir. Bir eşleşme bulduğunda, tahmin edilen orijinal kodlamayı, tahmin edilen yanlış okunan kodlamayı ve kurtarılan metni ve ayrıca düzeltmenin kaldırıldığı karakter sayısını gösterir (bozulan her karakter birkaç tane olduğundan mojibake her zaman geldiği metinden daha uzundur).

Otomatik algılama yalnızca doğrulanabilir yönü tahmin eder; UTF-8, yanlış kod sayfasında gösterilir. Daha nadir görülen ters durum, Latin-1 olarak okunan bir Windows-1250 veya ISO-8859-2 dosyasında eşdeğer bir yapısal kontrol yoktur, bu nedenle, sessizce tahmin etmek yerine, olanlardan zaten şüphelendiğiniz durumlar için açılır menüde manuel bir seçenek olarak sunulur. Bu buluşsal bir araçtır, bir garanti değildir: birden fazla dili karıştıran veya hedef kod sayfasının aralığı dışında semboller içeren metinler kurtarılamayabilir ve kendinden emin bir yanlış yanıt vermek yerine bunu açıkça belirtmektedir.

Her şey, tarayıcıların web sayfalarını oluşturmak için kullandığı kodlama tablolarının aynısını kullanarak tarayıcınızda yerel olarak çalışır; yapıştırdığınız hiçbir şey herhangi bir yere yüklenmez; bu, burada çoğu araçtan daha önemlidir, çünkü bozuk metinler genellikle gerçek müşteri kayıtlarından, dışa aktarılan veritabanlarından veya destek bildirimlerinden gelir.

FAQ

Hangi kodlamanın kullanıldığını nasıl biliyor?
Her aday kod sayfasının altındaki bozuk metni yeniden kodlar ve elde edilen baytların geçerli UTF-8 oluşturup oluşturmadığını kontrol eder. Doğru şekilde kodlanmış metin aslında bu kontrolü hiçbir zaman tesadüfen geçemez; dolayısıyla eşleşme, ne olduğuna dair güvenilir bir işarettir; kesin olmasa da yakındır.
Otomatik algılama neden "Latin-1 olarak oku" sorununu düzeltmeyi önermiyor?
Bu yönün kendisini doğrulamanın eşdeğer bir yolu yoktur; birçok bayt değeri, birden fazla kod sayfasındaki geçerli harflerdir, bu nedenle makul görünen ancak yanlış metin üretebilir. Durumun böyle olduğunu zaten bildiğinizde açılır menüden manuel olarak seçin.
Emoji veya karışık dil içeren metinleri düzeltebilir mi?
Yalnızca metindeki her karakter aday kod sayfasına aitse. Tek bir emoji veya bu aralığın dışındaki bir karakter, tüm satırın tersine çevrilemeyeceği anlamına gelir ve araç, tahmin etmek yerine onu değiştirmeden bırakır.
Bunun doğru olduğu garanti ediliyor mu?
Hayır — bu bir buluşsal yöntemdir, sertifikalı bir dönüştürücü değildir. Orijinal UTF-8'i eski kod sayfası mojibake olarak tanıma konusunda çok güvenilirdir ve kendinden emin bir yanlış yanıt vermek yerine, güvenli bir düzeltme bulamadığını açıkça söyleyecektir.
Metnim herhangi bir yere yüklendi mi?
Hayır. Algılama ve kurtarma, web sayfalarının oluşturulması için halihazırda gönderilen aynı kodlama tablolarını kullanarak tamamen tarayıcınızda çalışır; metin hiçbir zaman cihazınızdan ayrılmaz.