Ga naar inhoud
100% lokaal

Eigennamensextractor

Pak waarschijnlijke namen, plaatsen en merknamen uit een tekstblok.

Invoer

Eigennamensextractor

Plak een artikel, transcript of notities in en dit hulpmiddel haalt de woorden die waarschijnlijk namen, plaatsen of merkvermelding zijn eruit: gekapitaliseerde woorden die niet eenvoudig aan het begin van een zin staan. Dit is een snelle manier om te zien wie en wat een tekst werkelijk gaat, zonder deze regel voor regel te lezen.

Standaard telt een hoofdletter alleen wanneer deze halverwege een zin verschijnt, omdat een woord aan het begin van een zin ongeacht wat het is met een hoofdletter wordt geschreven. Schakel "Woordenboek-startwoorden opnemen" in om het net te vergroten wanneer u liever alles verzamelt dan iets mist. "Aangrenzende gekapitaliseerde woorden samenvoegen" voegt reeksen zoals "New York" of "Golden Gate Bridge" samen tot één entiteit in plaats van deze in aparte woorden op te splitsen, en "Veelgebruikte woorden negeren" verwijdert veel voorkomende met hoofdletters geschreven items – voornaamwoorden, greetings, weekdag- en maandnamen – die zelden de naam zijn die u wilt. Sorteer de resultaten op frequentie om te zien wat het meest wordt vermeld, of alfabetisch om een schone referentielijst door te scannen, en kies platte lijst of CSV-uitvoer afhankelijk van waar het resultaat heen gaat.

Het gereedschap herkent veelgebruikte afkortingen zoals "Dr.", "Mr." en "St." dus het woord daarna wordt niet per ongeluk behandeld als het begin van een nieuwe zin en overgeslagen. Het gaat op dezelfde manier om met Windows- en Unix-regelafbrekingen, gaat met zeer lange invoer zonder vertraging om, en de tally onder de uitvoer geeft aan hoeveel verschillende entiteiten zijn gevonden en hoe vaak ze in totaal voorkwamen.

Alles draait lokaal in uw browser – de tekst die u plakt, wordt nooit geüpload of ergens heen gestuurd. Wanneer u klaar bent, kopieert u het resultaat, downloadt u het als .txt-bestand of stuurt u de uitvoer rechtstreeks terug naar de invoer om het verder te verfijnen.

FAQ

Wat telt hier als "eigennaam"?
Elk gekapitaliseerd woord of, als het samenvoegen aanstaat, een reeks gekapitaliseerde woorden die niet eenvoudig het begin van een zin markeert. Het is een heuristiek gebaseerd op kapitalisatie, geen woordenboek van echte namen, dus het zal af en toe een gekapitaliseerd gemeenschappelijk woord vatten en een klein geschreven merk missen.
Waarom wordt een naam helemaal aan het begin van een zin overgeslagen?
Elk woord aan het begin van een zin wordt met een hoofdletter geschreven, echte naam of niet, dus het tellen van deze zou de resultaten met onwaar positieven overspoelen. Schakel "Woordenboek-startwoorden opnemen" in als u liever alles ziet.
Hoe werkt het samenvoegen van aangrenzende woorden?
Wanneer twee of meer gekapitaliseerde woorden naast elkaar staan, gescheiden door een enkele spatie, worden ze in één entiteit samengevoegd – "New York" in plaats van "New" en "York" afzonderlijk. Leestekens of een klein geschreven woord ertussenin stopt het samenvoegen.
Wat verwijdert "veelgebruikte woorden negeren"?
Een kleine ingebouwde lijst van vaak gekapitaliseerde woorden die zelden de naam zijn die u wilt: voornaamwoorden zoals "I", greetings en weekdag- of maandnamen. Multi-word entiteiten zoals "New York" worden nooit door dit filter beïnvloed.
Wordt mijn tekst ergens geüpload?
Nee. Extractie draait geheel in uw browser – uw tekst verlaat uw apparaat nooit.