0%
Découper les documents sans détruire le sens

Découper les documents

La décision la plus déterminante et la moins discutée de la chaîne

10-15 min

Découper les documents sans détruire le sens

Un manuel technique de 80 pages, découpé mécaniquement toutes les 1 000 caractères. Le fragment 47 se termine par : la pression maximale admissible est de. Le fragment 48 commence par : 12 bars, sauf pour les modèles antérieurs à 2018. Un utilisateur demande la pression maximale admissible. La recherche vectorielle ramène le fragment 47, parce que c'est lui qui contient les mots de la question. Le modèle reçoit une phrase tronquée, ne trouve aucune valeur, et répond que l'information n'est pas disponible. Vous avez indexé la bonne page et perdu la bonne réponse.

Ce scénario n'est pas un cas limite, c'est le mode d'échec le plus fréquent des premiers prototypes. Le découpage détermine ce qu'un fragment peut signifier tout seul, hors de son document, une fois sorti de son contexte. Un fragment est une unité de sens autonome ou il n'est rien : il sera récupéré seul, lu seul, et cité seul. Découper par nombre de caractères, c'est décider que le sens s'arrête tous les 1 000 signes, ce qui n'est vrai pour aucun document écrit par un humain.

Commentaires

Les commentaires sont alimentés par GitHub Discussions

Connectez-vous avec GitHub pour participer à la discussion

Lien copié !