0%
Classification de textes

Classification de textes

Construire un classifieur de textes fiable : références honnêtes, découpes sans fuite, métriques qui ne mentent pas et analyse systématique des erreurs.

10-15 min

La classification de textes est la tâche la plus rentable du NLP appliqué. Trier des courriels indésirables, router des tickets de support vers la bonne équipe, détecter un avis client mécontent, repérer un document confidentiel : dans tous ces cas, une entrée textuelle doit produire une étiquette parmi un ensemble fini.

Elle est aussi la tâche où l'on se trompe le plus facilement sur sa propre performance. Un classifieur qui annonce 97 % de justesse sur un problème où 97 % des exemples appartiennent à une seule classe n'a rien appris : il répond toujours la même chose. Un classifieur entraîné sur des données mal découpées apprend l'identité de ses exemples plutôt que leur contenu, et affiche un score que la production démentira brutalement.

C'est pourquoi cette leçon consacre autant de place à l'évaluation qu'à l'entraînement. Entraîner un modèle de texte demande cinq lignes de scikit-learn ; savoir si on peut lui faire confiance en demande beaucoup plus. L'ordre adopté ici est celui d'un vrai projet : définir les étiquettes, constituer les données, poser une référence stupide, entraîner, mesurer correctement, puis regarder les erreurs une par une.

Lien copié !