İçeriğe atla
TextArray

Çevrimiçi olarak kelimeler ve karakterler nasıl sayılır (ve sayıların neden farklı olduğu)

Blog /

Aynı metni Microsoft Word'e, Twitter'a, Google Dokümanlar'a ve bir tarayıcı sayacına yapıştırdığınızda dört farklı karakter sayısı görebilirsiniz. Bu bir hata değil; bunun nedeni, her uygulamanın biraz farklı bir şeyi sayması ve hepsinin teknik olarak doğru olmasıdır. Karakter sınırı olan bir makale başlığı, tweet veya SEO metni yazarken farkı anlamak önemlidir.

Kelimeler vs karakterler vs boşluksuz karakterler

kelime sayacı üç basit ölçüm arasında ayrım yapar. Kelimeler boşluk veya noktalama işaretiyle ayrılmış harf, sayı ve kesme işareti dizileridir. Karakterler Boşluklar, noktalama işaretleri ve emoji dahil her bir karakteri sayın. Boşluksuz karakterler boşlukları bırakın ancak geri kalan her şeyi saklayın. Karakter sınırı olan bir tweet için bu ayrım önemlidir: Sınır, tarayıcıların sayımına uygulanır; bu, boşluklar dahil tam karakter sayımıdır.

Word, Twitter ve tarayıcılar neden aynı fikirde değil?

Anlaşmazlık, farklı sistemlerin metni temsil etme biçiminden kaynaklanmaktadır. Çoğu İngilizce metin basittir; düzenleyicideki bir karakter sayılacak bir birime eşittir. Ancak aksan işaretlerini ve Latin olmayan alfabeleri birleştiren emoji bu varsayımı bozuyor. 👨‍👩‍👧 (aile) gibi bir emoji tek bir glif olarak oluşturulabilir ancak çoklu olarak kodlanmıştır kod noktaları (dahili Unicode birimleri). Microsoft Word onu bir karakter, Twitter'ı üç karakter ve Unicode uyumlu bir aracı beş karakter olarak sayabilir. Benzer şekilde, bir Çince karakter veya é gibi vurgulu bir harf, nasıl kodlandığına bağlı olarak tek bir karakter veya bir temel karakter artı bir birleştirme işareti olabilir.

Fark, ölçtüğünüz şeye bağlıdır: Unicode kod noktaları (teknik birim), UTF-16 kod birimleri (JavaScript ve Twitter gibi bazı sistemlerin bunları nasıl kodladığı) veya grafik kümeleri (kullanıcının tek bir karakter olarak gördüğü şey). Çoğu pratik amaç için, kelime sayacı TextArray üzerinde, kullanıcı beklentilerine uyan ve emojiler arasında tutarlı bir şekilde çalışan, işaretleri ve yazıları birleştiren grafikleri (gerçekte gördüğünüz şeyleri) sayar.

Bayt saymanız gerektiğinde

Farklı yerler için farklı sınırlar geçerlidir. Sosyal medya genellikle karakterleri sayar. Veritabanı alanları veya API'ler sayılabilir bayt — kodlamadan sonraki gerçek depolama birimleri. Tek bir emoji, UTF-8 kodlamasında 4 bayt yer kaplar. Çince bir karakter 3 bayt alır. Bayt sınırı olan bir sisteme metin yapıştırıyorsanız, karakter sayısı tek başına size uyup uymayacağınızı söylemez. UTF-8 bayt sayacı metninizin tam bayt maliyetini gösterir; bu, API sınırlarına veya veritabanı kısıtlamalarına ulaştığınızda önemlidir.

Okuma süresi ve cümle sayısı

Daha uzun yazılar (blog yazıları, makaleler, belgeler) için kelime sayımı, okuma süresinden daha az faydalıdır. Cümle uzunluğuna ve karmaşıklığına bağlı olarak bin kelime farklı okunur. okuma zamanı araç, ortalama bir okuyucunun bitirmesinin ne kadar süreceğini tahmin ederek, parçanın hızlı bir inceleme mi yoksa derin bir inceleme mi olduğu konusunda size fikir verir. Onun yanında, cümle sayacı okunabilirlik için kaba ama yararlı bir sinyal olan ortalama cümle uzunluğunu gösterir; daha kısa cümleleri okumak genellikle daha kolaydır.

Tüm sayımlar yerel ve anlıktır

TextArray'teki her sayım tamamen tarayıcınızda çalışır. Metninizi yapıştırırsınız ve sonuçlar anında güncellenir. Yükleme yok, sunucu yok ve hesap yok; metin asla cihazınızdan ayrılmıyor. Yayınlamadığınız taslaklarla, hassas içerikle veya rastgele bir web sitesine yapıştırmak istemediğiniz herhangi bir şeyle çalışırken bu önemlidir. Ağ bağlantısını kestiğinizde araçlar çalışmaya devam eder.