Aller au contenu
Tout en local

Détecteur de langue

Estime dans quelle langue un texte est écrit, classé par confiance.

Entrée

Détecteur de langue

Collez n'importe quel texte et cet outil estime dans quelle langue il est écrit, classant les candidats les plus probables par un score de confiance. Il compare le texte avec un profil de mots de fonction courants et de lettres diagnostiques pour chaque langue supportée, ce qui fonctionne sur tout, d'une seule phrase à un long document, un extrait de journal ou une liste de commentaires d'utilisateurs dans une langue inconnue.

L'option de groupe de langue restreint la recherche à une famille — slave, germanique, romane ou autre — ce qui aide quand vous savez déjà à peu près avec quoi vous avez affaire et que vous voulez une réponse plus précise. La longueur minimale définit le nombre de caractères que l'outil attend avant de considérer un résultat comme fiable; les extraits plus courts reçoivent toujours une estimation, juste avec un avertissement attaché. Évaluer vous permet de noter le texte entier comme une unité, ou chaque ligne ou paragraphe séparément, utile pour le texte qui change de langue à mi-chemin. Distinguer les langues proches donne un poids supplémentaire aux lettres qui sont effectivement uniques pour un côté d'une paire couramment confuse, comme le ľ et ô du slovaque contre le ř et ě du tchèque, ou le đ du croate contre le slovène. Les scores peuvent être affichés en pourcentages ou valeurs brutes, et la sortie peut être la liste classée complète ou juste le code de langue avec la meilleure estimation.

La détection est approximative par nature — le texte très court, les phrases code-switching ou les langues qui partagent la plupart de leurs mots courants réduisent la confiance, et l'outil le dit plutôt que de deviner avec une fausse certitude. Quand il soupçonne qu'un texte mélange plus d'une langue, il ajoute une note au lieu de choisir silencieusement l'une.

FAQ

Quelle est la précision de la détection?
Il fonctionne bien sur une phrase complète ou plus dans l'une des langues prises en charge, surtout une fois que des diacritiques ou d'autres lettres distinctives sont présentes. Les très courts extraits, le texte contenant uniquement des chiffres ou les langues qui partagent la plupart des mots courants obtiennent des scores plus faibles et sont signalés comme moins fiables.
Pourquoi affiche-t-il plusieurs langues au lieu d'une seule?
Le classement montre le degré de confiance de l'outil par rapport aux alternatives. Une seule langue dominante marque généralement bien au-dessus du reste; une course serrée entre deux ou trois signifie que le texte est ambigu ou court.
Qu'est-ce qui change exactement avec "Distinguer les langues proches"?
Il ajoute un poids supplémentaire aux lettres qui sont effectivement uniques à une langue dans une paire confondible, comme le slovaque par rapport au tchèque ou le croate par rapport au slovène, ce qui élargit généralement l'écart entre eux sans affecter les autres langues.
Peut-il détecter les langues qui ne figurent pas dans la liste des groupes de langues?
Non — il ne classe que les langues pour lesquelles il dispose d'un profil. Le texte dans une langue non prise en charge affichera des scores faibles, à peu près uniformes sur le tableau plutôt qu'une correspondance confiante.
Mon texte est-il chargé quelque part?
Non. La détection s'exécute entièrement dans votre navigateur à l'aide d'un petit profil de mots et de lettres intégré — votre texte ne quitte jamais votre appareil.