← Retour au blog
article
cost-optimization·2026-03-22·8 min de lecture

Économie des tokens à grande échelle

Comment la mise en cache des chemins d’exécution des agents élimine 90% des coûts LLM.

Le coût caché des systèmes agents

La plupart des équipes qui construisent des systèmes agents sous-estiment drastiquement leurs coûts en tokens à grande échelle. Un agent simple qui gère le déploiement peut consommer 4 000 tokens par exécution. Exécutez-le 100 fois par jour et vous brûlez 400 000 tokens quotidiennement. Au tarif GPT-4, c’est environ 12$/jour pour un seul agent effectuant une seule tâche.

Multipliez par 50 agents dans votre organisation, ajoutez la logique de retry, l’error handling, et vous atteignez 30 000–50 000$/mois en coûts LLM seuls. Pour des opérations fondamentalement répétitives.

L’insight de la répétition

Voici l’observation clé : la plupart des exécutions d’agents sont répétitives. Un agent de déploiement suit les mêmes étapes à chaque fois. Un agent de réponse aux incidents exécute la même séquence diagnostique pour la même classe d’alertes.

Dans un système agent traditionnel, chaque répétition consomme des tokens frais. Le modèle re-raisonne à zéro à chaque fois, même quand le chemin de raisonnement et les actions résultantes sont identiques au run précédent. C’est l’équivalent de recompiler tout votre code pour chaque déploiement au lieu d’utiliser des artefacts de build cachés.

Répartition des coûts
Agent traditionnel (par run) :
~4 000 tokens
Replay en cache (par run) :
0 tokens

Cache des chemins d’exécution

La solution est le cache des chemins d’exécution. Quand un agent exécute une tâche pour la première fois, la couche d’exécution déterministe enregistre le graphe d’exécution complet. Cet enregistrement est stocké comme un artefact rejouable.

Quand la même tâche réapparaît — mêmes entrées, même contexte, mêmes préconditions — le système rejoue le chemin d’exécution en cache au lieu d’appeler le LLM. Zéro tokens consommés.

Stratégies d’invalidation du cache

Le problème le plus difficile du caching est l’invalidation. Un chemin d’exécution caché doit être invalidé quand l’une de ses préconditions change. Le modèle de graphe d’exécution rend cela tractable car chaque précondition est explicite. Quand une condition change, seul le sous-graphe affecté est invalidé — pas le chemin entier.

L’impact économique

En pratique, nous observons des taux de cache hit de 85–95% pour les charges agents typiques. Une équipe dépensant 40 000$/mois en coûts LLM agents voit ce montant chuter à 6 000$/mois. Les économies se composent en scalant : ajouter de nouveaux agents a un coût marginal quasi nul pour les chemins cachés.

Mais le coût n’est que la moitié de l’histoire. Les replays cachés sont aussi 10–100x plus rapides que l’exécution via LLM car ils sautent l’étape d’inférence du modèle. Vos agents répondent en millisecondes au lieu de secondes.