0%
Coûts, latence et mise à jour en production

Mise en production

Le prototype coûte trois euros, le service en coûte trois mille

10-15 min

Coûts, latence et mise à jour en production

Un service RAG passe en production avec 300 utilisateurs. Deux semaines plus tard, la facture mensuelle atteint quatre chiffres et la latence médiane dépasse cinq secondes aux heures de pointe. Personne n'avait chiffré le coût par requête, parce qu'en développement chaque test coûtait un centième d'euro. Le même mois, un document est retiré du site interne pour cause d'erreur juridique ; il reste dans l'index vectoriel et le système continue de le citer pendant trois semaines.

Ces deux problèmes ont une cause commune : le prototype n'a pas de cycle de vie. Il indexe une fois, répond quelques dizaines de fois, et rien ne change. Un service en production doit absorber des documents qui évoluent, des documents qui disparaissent, des pics de charge, et rendre des comptes sur son coût. Ces contraintes ne s'ajoutent pas à la fin : elles déterminent des choix d'architecture qu'il est très coûteux de reprendre après coup.

Chiffrer le coût par requête

Décomposez avant d'optimiser. Une requête consomme des jetons d'entrée, des jetons de sortie, un plongement de la question, et éventuellement un reclassement.

Commentaires

Les commentaires sont alimentés par GitHub Discussions

Connectez-vous avec GitHub pour participer à la discussion

Lien copié !