0%
Projet : analyse de sentiments de bout en bout

Projet : analyse de sentiments de bout en bout

Un projet complet sur des critiques de films en français : données, référence TF-IDF, CamemBERT affiné, matrice de confusion et analyse des erreurs.

10-15 min

Les neuf leçons précédentes ont introduit des pièces séparées. Ce projet les assemble sur un problème unique, du chargement des données jusqu'à la discussion des erreurs du modèle final. C'est l'exercice qui compte, parce que dans un projet réel la difficulté n'est jamais une technique isolée : elle est dans l'enchaînement, où chaque décision contraint les suivantes.

L'objectif est de classer des critiques de films rédigées en français selon leur polarité. Le corpus est réel : il s'agit de critiques publiées sur Allociné, rassemblées et distribuées sous le nom allocine sur le Hub Hugging Face, avec deux classes — négatif et positif — dérivées des notes attribuées par leurs auteurs. Ce dernier point est important et sera discuté : l'étiquette n'est pas une annotation experte du texte, c'est une note transformée en catégorie, et cela crée un type d'erreur particulier.

La méthode suit un ordre non négociable. On regarde les données avant de modéliser. On pose une référence stupide, puis une référence sérieuse et non neuronale. On n'entraîne un transformeur qu'ensuite, et on le compare aux références sur le même jeu de test, ouvert une seule fois. Enfin on lit les erreurs, on les classe, et on teste explicitement la robustesse du modèle sur des cas construits pour le faire échouer.

Lien copié !