Hoe je woorden en karakters online kunt tellen (en waarom de cijfers verschillen)
Plak dezelfde tekst in Microsoft Word, Twitter, Google Docs en een browserteller, en u ziet mogelijk vier verschillende tekenaantallen. Het is geen bug, maar omdat elke app iets anders meetelt, en ze technisch allemaal correct zijn. Het begrijpen van het verschil is van belang wanneer u een artikeltitel, een tweet of een SEO-kopie met een tekenlimiet schrijft.
Woorden versus tekens versus tekens zonder spaties
De woordenteller maakt onderscheid tussen drie eenvoudige metingen. Woorden zijn reeksen letters, cijfers en apostrofs, gescheiden door witruimte of leestekens. Karakters tel elk afzonderlijk teken, inclusief spaties, interpunctie en emoji. Tekens zonder spaties laat de witruimte vallen, maar behoud al het andere. Voor een tweet met een tekenlimiet is dit onderscheid van belang: de limiet wordt toegepast op wat browsers tellen, namelijk het volledige aantal tekens inclusief spaties.
Waarom Word, Twitter en browsers het daar niet mee eens zijn
Het meningsverschil ontstaat vanwege de manier waarop verschillende systemen tekst representeren. De meeste Engelse tekst is duidelijk: één teken in de editor staat gelijk aan één te tellen eenheid. Maar emoji, die diakritische tekens en niet-Latijnse schriften combineren, doorbreekt deze veronderstelling. Een emoji zoals 👨👩👧 (familie) kan worden weergegeven als een enkele glyph, maar is gecodeerd als meerdere code punten (de interne Unicode-eenheden). Microsoft Word kan het als één teken tellen, Twitter als drie en een Unicode-bewuste tool als vijf. Op dezelfde manier kan een Chinees teken of een letter met accenten zoals é een enkel teken of een basisteken plus een combinatieteken zijn, afhankelijk van hoe het is gecodeerd.
Het verschil komt neer op wat je meet: Unicode-codepunten (de technische eenheid), UTF-16-code-eenheden (hoe sommige systemen zoals JavaScript en Twitter deze coderen), of grafeem clusters (wat de gebruiker ziet als een enkel teken). Voor de meeste praktische doeleinden is de woordenteller op TextArray telt grafemen (wat je daadwerkelijk ziet) die overeenkomen met de verwachtingen van de gebruiker en consistent werken in emoji's, waarbij markeringen en scripts worden gecombineerd.
Wanneer u bytes moet tellen
Voor verschillende plaatsen gelden verschillende limieten. Sociale media tellen vaak karakters. Databasevelden of API's kunnen meetellen bytes — de feitelijke opslageenheden na codering. Een enkele emoji neemt 4 bytes in beslag in UTF-8-codering. Een Chinees karakter neemt 3 bytes in beslag. Als je tekst in een systeem met een bytelimiet plakt, kun je op basis van het aantal tekens alleen niet zien of je daarin past. De UTF-8 byteteller toont de exacte bytekosten van uw tekst, wat van belang is wanneer u API-limieten of databasebeperkingen bereikt.
Leestijd en aantal zinnen
Voor langer schrijven (blogposts, artikelen, documentatie) is het aantal woorden minder nuttig dan de leestijd. Duizend woorden lezen anders, afhankelijk van de zinlengte en complexiteit. De leestijd tool schat hoe lang het een gemiddelde lezer zal kosten om het uit te lezen, waardoor je een idee krijgt of het stuk een snelle vlucht of een diepe duik is. Daarnaast staat de zin teller toont de gemiddelde zinslengte, wat een grof maar nuttig signaal is voor de leesbaarheid; kortere zinnen zijn meestal gemakkelijker te lezen.
Alle tellingen zijn lokaal en direct
Elke telling op TextArray wordt volledig in uw browser uitgevoerd. U plakt uw tekst en de resultaten worden onmiddellijk bijgewerkt. Er is geen upload, geen server en geen account: de tekst verlaat nooit uw apparaat. Dat is van belang als u werkt met concepten die u nog niet heeft gepubliceerd, met gevoelige inhoud of met iets dat u liever niet op een willekeurige website plakt. U kunt de verbinding met het netwerk verbreken en de tools blijven werken.