Reconnaissance d'entités nommées
Extraire personnes, lieux et organisations d'un texte français avec spaCy et CamemBERT : format BIO, alignement des sous-mots, évaluation par entité.
Classer un document, c'est lui attribuer une étiquette. Reconnaître ses entités nommées, c'est en extraire une structure : qui, où, quand, quelle organisation, quel montant. On passe d'une prédiction par document à une prédiction par mot, et cette différence change tout — le format des données, l'architecture du modèle, et surtout la manière de mesurer la réussite.
L'usage est immédiatement concret. Un cabinet reçoit dix mille courriers et veut savoir quelles sociétés y sont mentionnées. Un service de presse veut suivre les personnalités citées. Un service juridique doit pseudonymiser des dossiers avant de les transmettre, ce qui suppose de trouver tous les noms de personnes — un rappel de 95 % signifie ici qu'une identité sur vingt fuite.
Le français ajoute ses difficultés propres. Les particules nobiliaires et les prépositions s'intègrent aux noms (« Charles de Gaulle », « Jeanne d'Arc »), les articles font partie de certains toponymes (« Le Havre », « La Rochelle »), les noms d'institutions sont longs et partiellement en minuscules (« ministère de l'Économie et des Finances »), et la majuscule — signal le plus fort du modèle — disparaît complètement dans du texte saisi rapidement ou transcrit automatiquement.