Détecteur de langue
Estime dans quelle langue un texte est écrit, classé par confiance.
Détecteur de langue
Collez n'importe quel texte et cet outil estime dans quelle langue il est écrit, classant les candidats les plus probables par un score de confiance. Il compare le texte avec un profil de mots de fonction courants et de lettres diagnostiques pour chaque langue supportée, ce qui fonctionne sur tout, d'une seule phrase à un long document, un extrait de journal ou une liste de commentaires d'utilisateurs dans une langue inconnue.
L'option de groupe de langue restreint la recherche à une famille — slave, germanique, romane ou autre — ce qui aide quand vous savez déjà à peu près avec quoi vous avez affaire et que vous voulez une réponse plus précise. La longueur minimale définit le nombre de caractères que l'outil attend avant de considérer un résultat comme fiable; les extraits plus courts reçoivent toujours une estimation, juste avec un avertissement attaché. Évaluer vous permet de noter le texte entier comme une unité, ou chaque ligne ou paragraphe séparément, utile pour le texte qui change de langue à mi-chemin. Distinguer les langues proches donne un poids supplémentaire aux lettres qui sont effectivement uniques pour un côté d'une paire couramment confuse, comme le ľ et ô du slovaque contre le ř et ě du tchèque, ou le đ du croate contre le slovène. Les scores peuvent être affichés en pourcentages ou valeurs brutes, et la sortie peut être la liste classée complète ou juste le code de langue avec la meilleure estimation.
La détection est approximative par nature — le texte très court, les phrases code-switching ou les langues qui partagent la plupart de leurs mots courants réduisent la confiance, et l'outil le dit plutôt que de deviner avec une fausse certitude. Quand il soupçonne qu'un texte mélange plus d'une langue, il ajoute une note au lieu de choisir silencieusement l'une.