Le contexte est la partie de la dépense qui croît le plus sans que personne ne l’ait décidé. Personne n’approuve « payons le triple » : on ajoute un document au prompt, puis un autre, et la facture monte. Chaque token de contexte est facturé à chaque requête, et c’est ce qui transforme une fenêtre longue en problème de coût.
Pourquoi cela coûte cher
Un modèle ne retient rien entre deux requêtes. Tout ce que vous voulez qu’il sache —instructions, exemples, historique, documents— repart à chaque requête et est refacturé. Si votre prompt porte 20 000 tokens de contexte et que vous faites 50 000 requêtes par mois, vous payez un milliard de tokens d’entrée rien que pour le contexte, quelles que soient les réponses.
Les trois fuites classiques
| Fuite | Ce qui la provoque | Comment la corriger |
|---|---|---|
| Historique complet | Toute la conversation est renvoyée à chaque tour | Résumer les tours anciens et n’envoyer que les récents |
| Documents entiers | Le PDF complet est joint « au cas où » | Ne récupérer que les fragments pertinents |
| Prompt système gonflé | Des instructions s’accumulent et ne sont jamais élaguées | Le réécrire et mesurer si la qualité baisse |
Récupérer plutôt que joindre
La correction structurelle consiste à ne pas mettre le corpus dans le prompt. On indexe les documents, on récupère les trois ou quatre fragments qui répondent à la question et on n’envoie que ceux-là. La qualité monte souvent —moins de bruit— et le contexte baisse d’un ordre de grandeur. Nous le développons dans RAG, fine-tuning et contexte.
Ce qu’il vaut mieux garder long
Toute coupe n’est pas bonne. Les instructions stables et les exemples qui fixent le format sont chers à retirer et bon marché à conserver si vous utilisez le prompt caching : le bloc fixe est mis en cache et facturé à une fraction. La règle pratique : contexte fixe et caché en haut, contexte variable et minimal en bas.
Mettez-y un chiffre
Avant de redessiner quoi que ce soit, mesurez. Entrez vos tokens d’entrée actuels et votre volume dans le calculateur de coût des tokens et comparez le même travail avec moitié moins de contexte : vous verrez la différence mensuelle d’un coup. Et suivez le coût par tâche avant et après pour confirmer que la qualité n’a pas baissé.
Questions fréquentes
Pourquoi le contexte long augmente-t-il autant le coût ? Parce que le contexte est envoyé et facturé à chaque requête. Un gros prompt ne se paie pas une fois : il se paie autant de fois que vous faites de requêtes.
Quelle quantité de contexte est excessive ? Il n’y a pas de chiffre absolu. Le signal est la proportion : si les tokens d’entrée dépassent largement ceux de sortie et qu’une bonne part sont des documents ou de l’historique, vous avez de la marge.
Réduire le contexte dégrade-t-il les réponses ? Souvent il les améliore, car le modèle cesse de rivaliser avec de l’information non pertinente. Ce qu’on ne peut pas faire, c’est couper sans mesurer le coût par tâche et la qualité avant et après.
Chez e-ficient, nous mesurons le coût par tâche d’entreprises qui exploitent déjà l’IA en production et vous disons combien vous économiseriez avec chaque levier à votre volume réel. Le premier audit est gratuit si vous souscrivez un forfait avec un engagement de trois mois et rend un diagnostic sous 72 heures.