Normalisation : casse, accents, lemmatisation
Minuscules, Unicode, accents, mots vides, racinisation et lemmatisation en français : chaque normalisation détruit de l'information, apprenez laquelle.
Normaliser, c'est décider volontairement de perdre de l'information. On passe tout en minuscules, donc on renonce à distinguer « État » de « état ». On retire les accents, donc « tache » et « tâche » deviennent un même mot. On supprime les mots vides, donc « je n'aime pas ce film » et « j'aime ce film » finissent identiques.
Cette dernière conséquence n'est pas un cas d'école. C'est l'erreur la plus fréquente et la plus coûteuse des projets d'analyse de sentiments francophones : les listes de mots vides toutes faites contiennent ne, pas, plus, sans, aucun — exactement les mots qui portent la négation. Un modèle entraîné après ce filtrage est structurellement incapable de distinguer une critique d'un éloge, et ses métriques ne le disent pas clairement.
La bonne question n'est donc pas « comment normaliser » mais « qu'est-ce que ma tâche a le droit d'oublier ». Pour de la recherche documentaire, écraser les accents est un service rendu à l'utilisateur qui tape sans accents. Pour de l'extraction d'entités, c'est une catastrophe : les noms propres se distinguent justement par leur graphie.