0%
Introduction au traitement du langage naturel

Introduction au traitement du langage naturel

Pourquoi le langage résiste aux machines, ce que le NLP sait réellement faire, et un premier pipeline spaCy en français installé et commenté pas à pas.

10-15 min

Une base de données sait comparer deux nombres. Elle ne sait pas décider si « le film n'était pas mauvais » est un compliment. Tout le traitement du langage naturel tient dans cet écart : le texte est la forme de donnée la plus abondante que produise l'humanité, et c'est la seule que l'informatique classique ne sait pas manipuler autrement que comme une suite d'octets.

La difficulté n'est pas la quantité, c'est l'ambiguïté. Prenez la phrase « Les avions volent bas ». Un lecteur français comprend immédiatement des appareils qui passent près du sol. Mais avions est aussi l'imparfait du verbe avoir, et volent peut signifier dérober. Sur le plan strictement formel, la phrase est ambiguë ; c'est votre connaissance du monde qui tranche, pas la grammaire. Multipliez ce genre de choix par la longueur d'un document et vous mesurez le problème : il n'existe aucune règle exhaustive, seulement des indices statistiques à accumuler.

À cela s'ajoute que le français n'est pas l'anglais. La plupart des outils de NLP ont été conçus, entraînés et évalués sur de l'anglais, une langue peu fléchie, sans accents, où l'apostrophe est rare. Le français élide (« l'État »), accorde (« sont allées »), accentue (« tache » n'est pas « tâche ») et colle ses pronoms (« donne-le-moi »). Un pipeline copié d'un tutoriel anglophone produit du texte français abîmé sans jamais lever d'erreur — c'est le pire des cas, parce que rien ne prévient.

Lien copié !