Les fournisseurs de LLM facturent les jetons. Le calcul est simple une fois connus les quatre facteurs : le modèle utilisé, le nombre de jetons d’entrée et de sortie par requête, la part de l’entrée pouvant être mise en cache et la possibilité de traiter la tâche par lots. Ce calculateur convertit ces facteurs en coûts mensuels et annuels et compare les modèles sur une même charge de travail. Ce guide explique le rôle de chaque facteur et où réaliser des économies.
Comment fonctionne la tarification des jetons
Chaque requête est facturée en jetons, des fragments de mots d’environ quatre caractères. Les fournisseurs publient deux tarifs principaux pour chaque modèle : le prix par million de jetons d’entrée (tout ce que vous envoyez) et celui par million de jetons de sortie (tout ce que le modèle génère). Le coût d’une requête correspond à la somme, pour chaque catégorie, du nombre de jetons divisé par un million et multiplié par son tarif.
Le point essentiel est que la sortie coûte bien plus cher que l’entrée : généralement trois à six fois plus. Pour Claude Sonnet 4.6, l’entrée coûte 3 $/million et la sortie 15 $/million ; pour GPT-5.5, les tarifs sont de 5 $ et 30 $. Un modèle qui produit des réponses longues peut donc coûter plus cher qu’un modèle plus cher à l’unité mais plus concis. Si une facture vous surprend, examinez d’abord la longueur des sorties.
Coût des entrées et des sorties : pourquoi le choix du modèle compte
Comme les deux tarifs diffèrent fortement, le modèle le moins cher n’est pas toujours le moins coûteux pour votre charge de travail. Si celle-ci envoie de longs prompts et attend des réponses courtes, le coût des entrées domine et un modèle de milieu de gamme peut être très avantageux. Si elle génère de longs documents, le coût des sorties domine ; un modèle plus petit et plus rapide peut alors faire économiser davantage que la réduction des entrées.
L’onglet Comparer les modèles sert à cela : il garde constants le nombre de jetons et le volume, puis recalcule les coûts avec trois modèles, en répartissant chaque barre entre entrée, entrée en cache et sortie. Un modèle de gamme inférieure peut souvent effectuer la tâche pour une fraction du coût ; seule une comparaison avec vos chiffres réels permet de le vérifier.
Mise en cache des prompts et réductions par lots
Deux fonctions des fournisseurs réduisent les coûts sans changer de modèle ni de prompt. La mise en cache des prompts stocke le préfixe stable d’une requête — prompt système, instructions détaillées ou contexte récupéré — afin que les requêtes répétées n’aient pas à le retraiter. La lecture des jetons en cache coûte environ 10 % du tarif d’entrée. La première requête entraîne toutefois un supplément unique d’écriture (environ 1.25 fois le tarif d’entrée chez Anthropic) ; le cache est donc avantageux lorsque le même préfixe est réutilisé de nombreuses fois pendant sa période de rétention.
Batch API exécute les requêtes de façon asynchrone aux tarifs par lots publiés par le fournisseur. De nombreux tarifs par jeton représentent 50 % du tarif standard, mais certains composants, comme les lectures du cache, varient selon le fournisseur. Si votre tâche tolère un délai de quelques minutes à quelques heures — synthèse en masse, classification, évaluations ou enrichissement de données — comparez les tarifs affichés avant de la traiter par lots. Les deux fonctions peuvent se cumuler : une charge de travail bien dimensionnée, mise en cache et traitée par lots peut coûter une petite fraction de l’estimation initiale.
Estimer les jetons et éviter les mauvaises surprises
Pour établir un budget avant le développement, il faut estimer le nombre de jetons. En anglais, comptez environ quatre caractères ou 0.75 mot par jeton : un document de 2,000 mots représente donc près de 2,700 jetons. L’onglet Estimateur de jetons effectue cette conversion à partir d’un texte collé ou d’un décompte. Utilisez ce résultat comme indication : le code, le JSON, les textes non anglais et le vocabulaire inhabituel sont segmentés différemment. Pour un décompte exact, utilisez le tokenizer ou le point de terminaison de comptage du fournisseur.
Deux surprises sont fréquentes : l’historique de conversation est renvoyé et refacturé à chaque tour, sauf s’il est mis en cache ou raccourci, ce qui rend les conversations longues plus coûteuses ; le contexte récupéré est aussi facturé comme entrée à chaque requête, même si la question de l’utilisateur est brève. Les modèles et les prix de cet outil ont été vérifiés le 29 août 2026 et figurent dans un tableau daté du code. Vérifiez toujours la page tarifaire du fournisseur avant d’établir un budget, car les tarifs évoluent.