0%
Transfert d'apprentissage

Transfert d'apprentissage

Réutiliser un réseau pré-entraîné plutôt que repartir de zéro : sonde linéaire, réglage fin, gel correct de la BatchNorm et choix selon vos données.

10-15 min

Transfert d'apprentissage

Vous avez huit cents photos étiquetées et un problème de classification à résoudre. Le chapitre 2 a établi ce qui va se passer si vous entraînez un réseau profond depuis zéro : il mémorisera vos huit cents images et ne généralisera pas. Le chapitre 3 a montré que les architectures de vision sérieuses comptent des dizaines de millions de paramètres. Huit cents exemples pour dix millions de paramètres, c'est perdu d'avance, et aucune régularisation ne renversera ce rapport.

Il existe pourtant une issue, et c'est la pratique normale du domaine — pas un raccourci d'amateur. Quelqu'un a déjà entraîné un réseau sur un million d'images, a payé les milliers d'heures de calcul, et a publié les poids. Ce réseau a appris à détecter des contours, des textures, des motifs répétés, des formes composées. Rien de tout cela n'est spécifique aux classes qu'il devait reconnaître : ce sont les briques élémentaires de toute image naturelle. Vos huit cents photos en sont faites aussi.

Le transfert d'apprentissage consiste à récupérer ces briques et à n'apprendre que la dernière étape — la combinaison qui répond à votre question. Le nombre de paramètres à estimer tombe de dix millions à quelques milliers, et huit cents exemples suffisent soudain. Le gain est du même ordre que celui de la convolution sur la couche dense : on n'a pas trouvé un meilleur algorithme, on a évité de réapprendre ce qui était déjà su.

Lien copié !