Mise en production
Le prototype coûte trois euros, le service en coûte trois mille
Coûts, latence et mise à jour en production
Un service RAG passe en production avec 300 utilisateurs. Deux semaines plus tard, la facture mensuelle atteint quatre chiffres et la latence médiane dépasse cinq secondes aux heures de pointe. Personne n'avait chiffré le coût par requête, parce qu'en développement chaque test coûtait un centième d'euro. Le même mois, un document est retiré du site interne pour cause d'erreur juridique ; il reste dans l'index vectoriel et le système continue de le citer pendant trois semaines.
Ces deux problèmes ont une cause commune : le prototype n'a pas de cycle de vie. Il indexe une fois, répond quelques dizaines de fois, et rien ne change. Un service en production doit absorber des documents qui évoluent, des documents qui disparaissent, des pics de charge, et rendre des comptes sur son coût. Ces contraintes ne s'ajoutent pas à la fin : elles déterminent des choix d'architecture qu'il est très coûteux de reprendre après coup.
Chiffrer le coût par requête
Décomposez avant d'optimiser. Une requête consomme des jetons d'entrée, des jetons de sortie, un plongement de la question, et éventuellement un reclassement.
Commentaires
Les commentaires sont alimentés par GitHub Discussions
Connectez-vous avec GitHub pour participer à la discussion