Quand un agent IA appelle un modèle des milliers de fois par jour, le tarif au million de tokens devient un poste de dépense à part entière. Le 7 octobre 2026, Anthropic a annoncé Claude Haiku 5.5 avec une grille tarifaire qui change l'ordre de grandeur pour les tâches courtes et répétitives. Mais cette grille comporte un seuil, et le modèle n'est pas fait pour tout.
Cet article reprend les chiffres publiés par Anthropic, explique comment les lire, montre un calcul avec des hypothèses fictives explicites et propose une méthode pour décider, sur vos propres tâches, s'il vaut la peine de confier des sous-agents à ce modèle.
Ce qu'Anthropic a annoncé
D'après l'annonce d'Anthropic, Claude Haiku 5.5 (identifiant API claude-haiku-5-5) est disponible sur la plateforme Claude ainsi que sur Amazon Web Services, Google Cloud et Microsoft Azure. Quatre éléments comptent pour une équipe qui construit des agents :
- Un prix en deux paliers, selon la taille du prompt de la requête (jusqu'à 100 000 tokens, ou au-delà).
- Un réglage d'effort ajustable, une première pour un modèle de la classe Haiku, avec cinq niveaux (Low, Med, High, Xhigh, Max).
- Un nouveau tokenizer, qui, selon Anthropic, utilise « légèrement plus de tokens par tâche » que le modèle précédent.
- Un positionnement en sous-agent : Anthropic indique que Haiku 5.5 s'associe bien à Opus 5.5 et Sonnet 5.5 comme sous-agent sur des travaux de développement, et qu'il convient aux charges rapides et répétitives. Pour le codage agentique complexe, l'éditeur continue de recommander Sonnet 5.5 et Opus 5.5.
La grille tarifaire, ligne par ligne
Voici les prix publiés, en dollars par million de tokens.
| Poste | Haiku 5.5 (≤ 100k) | Haiku 5.5 (> 100k) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| Entrée | 0,10 $ | 0,50 $ | 1,00 $ | 2,00 $ |
| Sortie | 0,50 $ | 2,50 $ | 5,00 $ | 10,00 $ |
| Lecture du cache | 0,01 $ | 0,05 $ | 0,10 $ | 0,10 $ |
| Écriture du cache | 0,125 $ | 0,625 $ | 1,25 $ | 2,50 $ |
Anthropic indique que Haiku 5.5 coûte 90 % de moins que Haiku 4.5 jusqu'à 100 000 tokens, et 50 % de moins au-delà. L'éditeur précise qu'environ 90 % des requêtes adressées à Haiku 4.5 se situaient sous ce seuil, et évoque une baisse moyenne d'environ 75 %. Dans la même annonce, le prix des lectures de cache de Sonnet 5.5 passe de 0,20 $ à 0,10 $ par million de tokens.
Deux points de lecture pratiques :
- Le seuil s'applique à la requête, pas au mois. Le tarif réduit concerne les requêtes dont le prompt reste sous 100 000 tokens. Un agent qui renvoie à chaque étape un long historique peut franchir ce seuil sans que vous vous en rendiez compte.
- Le prix par token n'est pas le prix par tâche. Avec un tokenizer qui produit plus de tokens, la baisse effective par tâche sera un peu plus faible que celle affichée par token. C'est à mesurer, pas à supposer.
Un calcul avec des hypothèses fictives
L'exemple suivant n'est pas une mesure. Il sert à fixer un ordre de grandeur, avec des hypothèses que vous remplacerez par les vôtres.
Prenons un sous-agent de classement de demandes qui traite 1 000 requêtes par mois. Hypothèse : 20 000 tokens en entrée et 2 000 tokens en sortie par requête, soit 20 millions de tokens en entrée et 2 millions en sortie sur le mois, sans cache.
| Modèle | Calcul | Coût mensuel |
|---|---|---|
| Haiku 4.5 | 20 × 1 $ + 2 × 5 $ | 30 $ |
| Haiku 5.5 (≤ 100k) | 20 × 0,10 $ + 2 × 0,50 $ | 3 $ |
| Sonnet 5.5 | 20 × 2 $ + 2 × 10 $ | 60 $ |
Si le nouveau tokenizer ajoutait 10 % de tokens (hypothèse arbitraire, pour tester la sensibilité), le coût de Haiku 5.5 passerait à environ 3,30 $. L'écart avec Sonnet 5.5 resterait d'un facteur proche de 20 sur ce scénario.
Passons maintenant au cas où les prompts dépassent le seuil : 100 requêtes par mois, avec 150 000 tokens en entrée et 3 000 en sortie chacune, soit 15 millions de tokens en entrée et 0,3 million en sortie. Au tarif supérieur de Haiku 5.5, cela donne 15 × 0,50 $ + 0,3 × 2,50 $ = 8,25 $. La baisse existe toujours, mais elle est de 50 % par rapport à Haiku 4.5 (15 $ + 1,50 $ = 16,50 $), et non de 90 %.
Ce que ce calcul ne dit pas : le coût des erreurs. Un modèle moins cher qui se trompe davantage sur votre tâche peut annuler l'économie. Nous détaillons ce raisonnement dans notre article sur le coût par tâche réussie : le chiffre qui décide est le coût d'une tâche réussie, reprise humaine comprise, pas le prix du token.
Où un petit modèle a sa place dans un système d'agents
Le principe d'architecture est ancien, mais il devient plus rentable à appliquer : ne pas confier au modèle le plus puissant ce qu'un modèle léger sait faire de façon fiable. Anthropic cite lui-même, pour Haiku 5.5, des tâches à fort volume : résumés, compactage de contexte, requêtes de base de données, classification.
Dans une automatisation d'entreprise, cela se traduit par des rôles distincts :
- Le coordinateur : un modèle plus puissant planifie, décide et traite les cas ambigus.
- Les sous-agents : un modèle léger exécute des tâches bornées (extraire des champs d'un document, classer un message, résumer un fil de discussion).
- Les règles déterministes : tout ce qui peut s'écrire sans modèle (seuil de montant, champ vide, mot-clé précis) reste dans un workflow classique. Notre article sur les agents n8n détaille ce partage des rôles.
Le critère de découpage est la réversibilité et l'enjeu : un sous-agent qui classe des messages et dont les erreurs sont détectées en aval peut être léger ; celui dont la décision déclenche une action chez un client demande davantage de contrôle, quel que soit le modèle.
Quand rester sur un modèle plus puissant
Anthropic le dit dans son annonce : Sonnet 5.5 et Opus 5.5 restent préférables pour le codage agentique complexe, Haiku 5.5 étant plutôt adapté aux tâches plus circonscrites. Quelques signaux montrent qu'il vaut mieux ne pas migrer :
- la tâche demande un raisonnement long ou plusieurs outils enchaînés avec des décisions intermédiaires ;
- les prompts dépassent régulièrement 100 000 tokens, ce qui réduit l'avantage tarifaire ;
- une erreur est coûteuse et difficile à détecter ;
- vous n'avez pas de jeu d'essai pour comparer les résultats avant et après.
Dans ces cas, la bonne question est souvent ailleurs : raccourcir le contexte, mettre en cache ce qui se répète, ou découper la tâche, plutôt que changer de modèle.
Tester Haiku 5.5 sur vos sous-agents : méthode en cinq étapes
- Lister les appels de modèle de votre agent et repérer ceux qui sont courts, répétitifs et bornés. Ce sont les candidats.
- Mesurer la taille réelle des prompts : quelle part des requêtes reste sous 100 000 tokens ? C'est elle qui bénéficie du tarif réduit.
- Réunir 30 cas réels par tâche, avec une définition écrite de la réussite, comme dans notre guide pour cadrer un premier agent IA.
- Comparer le modèle actuel et Haiku 5.5 sur ces cas, avec les mêmes consignes et plusieurs niveaux d'effort, en notant coût, taux de réussite et temps de réponse.
- Décider tâche par tâche, pas globalement, et garder une possibilité de revenir en arrière. Anthropic publie un guide de migration à consulter avant de changer l'identifiant du modèle en production.
Pensez aussi à l'effet du nouveau tokenizer sur vos limites de contexte et sur vos budgets : un prompt qui passait juste sous un seuil peut le dépasser.
FAQ
Combien coûte Claude Haiku 5.5 ?
D'après Anthropic, 0,10 $ par million de tokens en entrée et 0,50 $ en sortie pour les requêtes dont le prompt va jusqu'à 100 000 tokens. Au-delà, le tarif est de 0,50 $ en entrée et 2,50 $ en sortie.
Que change le seuil de 100 000 tokens ?
Il sépare deux tarifs. Sous le seuil, la baisse annoncée par rapport à Haiku 4.5 est de 90 % ; au-delà, de 50 %. Une architecture qui garde des prompts courts profite donc davantage du tarif réduit.
Haiku 5.5 peut-il remplacer Sonnet 5.5 dans un agent ?
Pas systématiquement. Anthropic le présente comme un sous-agent pour des tâches circonscrites et à fort volume, et recommande toujours Sonnet 5.5 et Opus 5.5 pour le codage agentique complexe. Il faut tester tâche par tâche.
Faut-il migrer tous ses appels vers Haiku 5.5 ?
Non. Commencez par les appels courts, répétitifs et faciles à vérifier, mesurez le coût par tâche réussie, puis étendez progressivement.
Le nouveau tokenizer change-t-il le calcul ?
Selon Anthropic, Haiku 5.5 utilise légèrement plus de tokens par tâche. La baisse réelle du coût par tâche sera donc un peu inférieure à la baisse du prix par token : mesurez-la sur vos propres données.
Sources
- Anthropic — Claude Haiku 5.5 (annonce du 7 octobre 2026)
- Anthropic — guide de migration vers Haiku 5.5
Pour aller plus loin
Vous voulez savoir quelles étapes de votre agent peuvent passer sur un modèle plus léger sans dégrader le résultat ? Décrivez-nous le processus : nous définissons ensemble le critère de réussite, le jeu d'essai et la mesure. Notre approche part toujours d'un cas précis, et nos offres détaillent les formats d'accompagnement. Pour situer les autres postes de dépense, voir aussi le coût de développement d'un agent IA.