Pour ne plus tomber sur "limite atteinte" en plein travail : ce qui fait fondre tes limites, comment marche le cache, et dix réflexes pour tenir plus longtemps avec le même abonnement, que tu codes ou pas.
L'unité de compte : le token
Le morceau de mot que Claude lit et écrit. Un mot courant tient souvent en un token, un mot long ou rare en prend plusieurs. Une page de texte, c'est de l'ordre de quelques centaines de tokens.
Tout se compte là-dessus : ce que tu envoies (l'input), ce que Claude écrit (l'output) et ce qu'il relit. Car à chaque message, Claude relit toute la conversation depuis le début, plus tes instructions, tes fichiers et la description de ses outils. Chez moi, une session Claude Code vide, avant que j'aie tapé quoi que ce soit, pèse déjà 63 514 tokens.
Deux détails qui comptent. Le français coûte plus de tokens que l'anglais pour dire la même chose (le détail dans ce cours TokenClimate). Et depuis Opus 4.7, un nouveau découpage donne environ 30 % de tokens en plus pour le même texte.
Deux façons de payer
L'abonnement (Pro, Max, Team, Enterprise). Un prix fixe par mois, avec deux limites : une limite de session qui se réinitialise toutes les 5 heures, et une limite hebdomadaire, tous modèles confondus, remise à zéro à heure fixe pour ton compte.
Ces limites sont partagées entre l'app Claude, Claude Code, Claude Desktop et Claude Design. Une après-midi de Design entame aussi ton quota Claude Code. Anthropic ne publie aucun quota chiffré, pour aucun plan.
J'ai fait le calcul sur 1 255 de mes sessions : 27 964 $ au prix API, pour moins de 2 000 $ d'abonnement. Pour un usage intensif, l'abonnement revient bien moins cher que l'API, à condition de tenir dans les limites.
À l'usage. Deux portes : les crédits d'usage quand tu dépasses ton abonnement, et l'API, qui se paie entièrement au token (voir chapitre 10).
Le paiement à l'usage qui prend le relais quand tu atteins ta limite d'abonnement. Tu continues au tarif API, avec un plafond mensuel que tu fixes et une recharge automatique si tu veux. Sur Pro et Max, tu les actives toi-même sur claude.ai/settings/usage ; sur Team et Enterprise, c'est l'admin. Rien à voir avec les crédits API inclus dans Max et Team, réservés à l'API et à l'Agent SDK.
Les plans et leurs prix
| Plan | Prix | À savoir |
|---|---|---|
| Free | 0 $ | Sonnet et Haiku. Docs, Slides et Design inclus depuis le 8 octobre 2026. |
| Pro | 20 $/mois (17 $/mois en annuel) | Opus, Sonnet, Haiku. Claude Code et Claude Design inclus. |
| Max 5x | 100 $/mois | Tous les modèles. 100 $ de crédits API par mois. |
| Max 20x | 200 $/mois | Tous les modèles. 200 $ de crédits API par mois. |
| Team | Siège Standard 20 $ (annuel) ou 25 $ (mensuel), Premium 100 $ ou 125 $ | De 2 à 150 sièges. Crédits API mutualisés, plafonnés à 500 $. |
| Enterprise | 20 $ par siège et par mois en self-serve, plus l'usage au tarif API | Pas de crédits API inclus. |
L'accès à Fable 5.1, le modèle le plus cher, dépend du plan et a changé plusieurs fois depuis juin 2026. Vérifie sur claude.com/pricing avant de compter dessus.
Ce qui consomme le plus
Du plus gros au plus discret :
- Le modèle. Au prix API, Fable 5.1 coûte 5 fois Sonnet 5.5 et 100 fois Haiku 5.5 en input. Sur abonnement, un modèle plus gros fait fondre tes limites plus vite.
- L'effort. C'est le niveau de réflexion de Claude avant de répondre (de low à max). Ce raisonnement est facturé comme de l'output, la partie la plus chère : 5 fois le prix de l'input.
- La longueur de la conversation. Au 50e message, Claude relit les 49 précédents. Une conversation qui s'étire coûte de plus en plus cher à chaque échange.
- Les tâches longues et les agents. Depuis le 16 septembre 2026, Claude décide lui-même de la quantité de travail qu'une demande mérite. Une tâche longue, c'est beaucoup de tours, de lectures de fichiers et d'appels d'outils.
- Claude Design. J'ai cramé 51 % de mon plan Max en 2 heures en refaisant mon site avec.
- Les connecteurs et les outils. Chaque outil branché ajoute sa description au contexte. Et ce qu'il ramène (un fil de 40 emails, une page Notion entière) aussi.
- La recherche. Une Deep Research parcourt de nombreuses pages web. Sur l'API, la recherche web coûte 10 $ les 1 000 requêtes, en plus des tokens.
Le cache, expliqué simplement
Quand tu envoies un message, Claude relit tout ce qui précède. Si ce début n'a pas bougé depuis ton dernier message, Anthropic le garde de côté : c'est le cache. Le relire depuis le cache coûte 10 à 40 fois moins cher que le relire à neuf (10 fois sur la plupart des modèles, 20 fois sur Opus 5.5 et Sonnet 5.5, 40 fois sur Fable 5.1).
Dans ma session Claude Code vide, 98,6 % de l'input est lu en cache, donc au tarif réduit.
Mais il expire.
| Où | Durée du cache |
|---|---|
| API | 5 minutes par défaut, 1 heure en option |
| Claude Code sur abonnement | 1 heure pour la conversation principale, 5 minutes pour les sous-agents |
| Claude Code sur crédits d'usage, clé API ou session cloud | 5 minutes |
| App Claude | Anthropic ne publie pas la durée |
Chaque lecture remet le compteur à zéro. Tant que tu enchaînes les messages, le cache reste chaud. Deux situations le cassent :
- La reprise après une pause. Tu reviens sur une longue conversation après le déjeuner : le cache a expiré, tout est relu à plein tarif. Une conversation de 300 000 tokens relancée à froid sur Opus 5.5, c'est environ 2,40 $ au prix API avec un cache d'une heure (1,50 $ avec un cache de 5 minutes). À chaud, la même relecture coûte autour de 0,06 $. Sur 30 jours, j'ai compté 147 reprises à froid.
- Le changement de modèle en route. Chaque modèle a son propre cache. Passer d'Opus à Sonnet au milieu d'une conversation fait tout relire à neuf. Dans mes mesures : 11 changements de modèle en 30 jours.
Dix réflexes, du plus rentable au moins rentable
- Ouvre une nouvelle conversation par sujet. C'est la recommandation officielle d'Anthropic, et le levier le plus fort : tu repars d'un contexte léger.
- Choisis le modèle selon la tâche. Haiku ou Sonnet pour reformuler, trier, résumer. Opus pour un raisonnement long. Fable quand le reste bloque.
- Baisse l'effort quand la tâche est simple. Un mail à reformuler n'a pas besoin de max. Monte seulement si la réponse déçoit.
- Garde le même modèle du début à la fin d'une conversation. Si tu dois changer, ouvre-en une nouvelle.
- Après une longue pause, repars d'un résumé. Demande à Claude de résumer la conversation, colle le résumé dans une nouvelle.
- Raccourcis tes instructions. Tes instructions perso et celles de tes projets sont relues à chaque message. Dix lignes utiles valent mieux que trois pages.
- Débranche ce qui ne sert pas. Connecteurs, recherche web, outils : coupe ce que la conversation n'utilise pas.
- Colle du texte plutôt qu'une capture. Un message d'erreur copié coûte moins cher qu'une image.
- Demande des réponses courtes, et groupe tes questions. L'output coûte 5 fois l'input. Trois questions dans un seul message, c'est une seule relecture de la conversation au lieu de trois.
- Pour du volume, passe par Haiku et le batch. Sur l'API, Haiku 5.5 coûte 0,10 $ le million de tokens en input, et le batch divise encore la facture par deux.
Question
80e message d'une conversation sur Opus. Pour économiser, tu passes sur Sonnet sans changer de conversation. Que se passe-t-il au message suivant ?
Choisis une réponse pour voir l'explication.
Suivre ta consommation
- Dans l'app Claude : Réglages > Usage (claude.ai/settings/usage), pour voir où tu en es de tes limites et activer les crédits d'usage.
- Dans Claude Code :
/usage(alias/costet/stats). Tu y vois une estimation en dollars, la répartition par skill, sous-agent et serveur MCP, et une ligne dédiée au cache avec le taux de lecture et la cause probable d'un cache raté.
/usage
/context
/context montre ce qui remplit ta fenêtre de contexte, et propose des pistes pour l'alléger.
Quand tu touches la limite
Trois options. Attendre la fin de la fenêtre de 5 heures, d'abord. Depuis le 22 septembre 2026, les abonnés disposent aussi d'un "limit reset" : une remise à zéro qu'ils peuvent garder de côté et utiliser au moment où ils bloquent. Dernière option, activer les crédits d'usage, avec un plafond mensuel (dans Claude Code : /usage-credits). Attention, dans Claude Code, passer sur les crédits d'usage ramène le cache de la conversation principale à 5 minutes.
Les crédits API inclus dans Max et Team depuis le 7 octobre 2026 ne servent pas ici : ils couvrent l'API, l'Agent SDK et les Managed Agents, pas l'app ni Claude Code (détail au chapitre 10).
Mesurer pour de vrai
La jauge de l'app montre où tu en es de tes limites. Pour le coût en euros, le modèle qui pèse le plus dans ton équipe ou l'empreinte carbone, il faut autre chose.
Je n'avais aucun moyen de voir ce que coûtait l'IA d'une équipe en euros et en CO2, donc j'ai construit TokenClimate, qui fait le calcul à partir des tokens. Son calculateur donne une première estimation, et le guide combien coûte Claude en entreprise aide à arbitrer entre plans et API.
Côté dev, le chapitre coûts du guide Claude Code va beaucoup plus loin : réglages du cache, /compact, sous-agents, MCP.
Question
Limite hebdomadaire atteinte en plein travail, sur Max 5x, avec 100 $ de crédits API inclus ce mois-ci. Qu'est-ce qui peut prendre le relais ?
Choisis une réponse pour voir l'explication.
À retenir
- Le réflexe qui rapporte le plus : une conversation par sujet.
- L'app, Claude Code et Design partagent tes limites de 5 h et hebdomadaires.
- Le cache rend la relecture 10 à 40 fois moins chère. Après une pause ou un changement de modèle, tout est relu à plein tarif.
- Pour une tâche simple, Haiku et un effort bas suffisent.
- Les crédits API de Max et Team ne couvrent ni l'app ni Claude Code.