Agents IA

Réduire le coût d'un agent IA : le coût par tâche réussie

Le modèle IA le moins cher ne réduit pas toujours le coût d'un agent. Pourquoi mesurer le coût par tâche réussie, avec l'exemple de Cloudflare Auto Router.

· 9 min de lecture · InfiniteLab

Quand la facture d'un agent IA grimpe, le réflexe est de chercher un modèle moins cher. C'est rarement le bon levier. Un modèle qui coûte moins par appel mais se trompe plus souvent peut coûter plus cher au total, parce que chaque erreur finit par une reprise humaine, un nouvel essai ou une correction chez un client.

Le 30 septembre 2026, Cloudflare a publié l'annonce d'Auto Router, un routeur qui choisit automatiquement le modèle à utiliser pour chaque requête. L'annonce a le mérite de mettre un chiffre sur la bonne question : non pas « combien coûte le token ? », mais combien coûte une tâche réussie ? Cet article détaille cet indicateur, ce que l'exemple de Cloudflare montre et ne montre pas, et une méthode pour le mesurer sur vos propres tâches avant de changer quoi que ce soit.

Ce que Cloudflare a annoncé

D'après l'annonce, Auto Router est disponible en bêta publique dans AI Gateway, la couche d'accès aux modèles de Cloudflare. On l'utilise en indiquant cloudflare/auto comme nom de modèle : le routeur envoie ensuite chaque requête vers un modèle jugé « assez capable » pour la tâche, sans que l'utilisateur ait à choisir.

Le fonctionnement décrit par Cloudflare se fait en deux temps. Une première étape classe la requête parmi 14 catégories de tâches et la note sur quatre dimensions (complexité, ambiguïté, enjeux, dépendance au contexte). Une seconde étape combine cette lecture avec des résultats de benchmarks pour arbitrer entre qualité attendue et coût. La documentation indique que les décisions peuvent être inspectées : des en-têtes de réponse précisent le modèle choisi et la raison du choix.

Cloudflare annonce une économie de coût « jusqu'à 30 % » par rapport à l'usage exclusif de modèles de pointe, mesurée en interne. L'annonce signale aussi un point souvent oublié : dans les longues sessions d'agent, le coût dépend moins du prix affiché du modèle que du coût de relecture du contexte en cache, qui grandit avec la longueur de la session.

Le bon indicateur : le coût par tâche réussie

Le prix au million de tokens décrit ce que vous payez par appel. Il ne dit rien de ce que vous obtenez. L'indicateur utile pour un processus métier est le coût par tâche réussie : ce que vous dépensez en moyenne pour obtenir un résultat correct.

Il se calcule simplement : le coût total des appels divisé par le nombre de tâches réussies. Un modèle bon marché qui échoue souvent voit ce ratio se dégrader, parce que ses échecs sont payés sans produire de résultat.

Cloudflare publie ce type de mesure dans son annonce, sur un benchmark interne :

Modèle (selon Cloudflare) Taux de réussite Coût par tâche réussie
cloudflare/auto 86,6 % 0,0084 $
Claude Opus 5.5 96,6 % 0,0210 $
GPT-6 Sol 84,2 % 0,0108 $

Lecture : dans ce benchmark, le routeur coûte moins cher par réussite que les deux modèles de référence (environ 22 % de moins que Sol et 60 % de moins qu'Opus, d'après nos calculs sur ces chiffres), mais son taux de réussite reste inférieur de dix points à celui d'Opus. Les deux informations comptent.

Ce que ce tableau dit, et ce qu'il ne dit pas

Ces chiffres sont ceux de l'éditeur, obtenus sur son propre benchmark. Cloudflare précise qu'il s'agit d'un benchmark interne de travail de bureau, composé de 97 tâches avec trois essais par modèle et par tâche, qui utilise des outils d'espace de travail simulés. La réussite est vérifiée objectivement : chaque tâche demande un résultat vérifiable ou une action accomplie.

Trois limites en découlent. Le benchmark n'est pas indépendant. Il compare trois options, pas l'ensemble du marché. Et surtout, il porte sur des tâches qui ne sont pas les vôtres : un écart mesuré sur du travail de bureau générique ne se transpose pas tel quel à un tri de réclamations, à une qualification de leads ou à une rédaction de devis.

Ce que le tableau enseigne, en revanche, est transposable : le meilleur marché par appel n'est pas forcément le meilleur marché par résultat, et le plus performant n'est pas forcément nécessaire pour chaque tâche. C'est le raisonnement à reprendre, avec vos propres données.

Quand l'économie d'API disparaît

Voici un exemple fictif, aux hypothèses explicites, pour illustrer l'ordre de grandeur. Ce n'est pas une mesure : remplacez les chiffres par les vôtres.

Prenons 1 000 tâches par mois et reprenons les taux et coûts du tableau ci-dessus :

  • avec le modèle le plus performant : 966 tâches réussies, soit environ 20 $ de coût d'API (966 × 0,0210 $) ;
  • avec le routeur : 866 tâches réussies, soit environ 7 $ (866 × 0,0084 $).

L'écart d'API est d'environ 13 $ par mois. Mais il y a 100 réussites de moins. Supposons que chaque échec demande 10 minutes de reprise à un salarié dont l'heure chargée coûte 40 € : cela représente environ 667 € de temps de reprise par mois.

Dans cette hypothèse, l'économie sur la facture d'API est négligeable devant le coût des échecs. Si, au contraire, les échecs sont bénins (la tâche est simplement relancée automatiquement, sans intervention humaine), l'équation s'inverse. C'est le coût d'un échec, pas le prix du token, qui décide. Cela rejoint ce que nous détaillons dans notre article sur les postes de coût d'un agent IA : l'usage des modèles n'est souvent qu'une partie de la facture.

Trois leviers à essayer avant un routeur

Un routeur automatique n'est qu'une des façons de réduire le coût. Avant d'en ajouter un, trois leviers plus simples méritent d'être testés. Ce sont des recommandations de méthode, pas des résultats publiés.

  1. Sortir du modèle les décisions qui n'en demandent pas. Une règle claire (montant inférieur à un seuil, mot-clé précis, champ vide) s'exécute dans un workflow déterministe, sans appel de modèle. Notre article sur n8n Agents détaille ce partage des rôles : l'agent décide quand c'est utile, les étapes simples et sensibles restent dans un mécanisme maîtrisé.
  2. Réserver le gros modèle aux cas difficiles. Un modèle plus léger peut suffire pour classer, extraire ou reformuler, avec un renvoi vers un modèle plus puissant quand le cas est ambigu. C'est précisément ce que cherche à automatiser un routeur, mais vous pouvez aussi l'écrire vous-même avec des règles simples.
  3. Surveiller la longueur du contexte. Puisque, d'après Cloudflare, le coût des longues sessions dépend de la relecture du contexte, raccourcir ce que l'agent relit à chaque étape peut compter plus que le choix du modèle.

Mesurer sur vos tâches : une méthode en cinq étapes

Avant de changer de modèle ou d'ajouter un routeur, mesurez sur vos propres données.

  1. Définir la réussite. Une tâche est réussie quand quoi ? Un résultat exact, validé par une règle ou par un relecteur. Sans définition écrite, aucun calcul n'a de sens.
  2. Réunir 30 cas réels, y compris des cas difficiles, tirés de votre activité. C'est un jeu d'essai, pas un benchmark scientifique.
  3. Tester deux ou trois modèles sur ces cas, avec les mêmes consignes, en notant le coût et le résultat de chaque essai.
  4. Calculer le coût par tâche réussie, en ajoutant le temps de reprise humaine pour les échecs.
  5. Recommencer à chaque changement important (nouveau modèle, nouveau prix, nouvelle consigne), car l'écart peut bouger. Cette démarche rejoint la méthode décrite dans notre guide pour cadrer un premier agent IA : périmètre écrit, jeu d'essai, déploiement par paliers.

Quand un routeur automatique se justifie, et quand il complique

Un routeur peut avoir du sens quand le volume est élevé, que les tâches sont de difficultés très variées et que les échecs sont peu coûteux ou détectés automatiquement. Il apporte alors une économie sans effort de configuration par tâche.

Il complique en revanche les situations où l'on a besoin de reproductibilité : le même texte peut être traité par des modèles différents d'un jour à l'autre, ce qui rend les écarts plus difficiles à expliquer. La documentation de Cloudflare précise elle-même que le fonctionnement du routeur peut changer dans le temps. Pour un processus où chaque erreur compte, mieux vaut un modèle choisi et testé, plutôt qu'un choix automatique.

Données et gouvernance : un point à vérifier avant d'activer un routeur

Un routeur envoie vos requêtes vers plusieurs fournisseurs de modèles. Avant de l'activer, vérifiez où transitent vos données, quelles conditions s'appliquent chez chaque fournisseur et si cela est compatible avec votre politique interne et le RGPD. Cloudflare liste d'ailleurs l'ajout d'une exigence de non-conservation des données dans le filtrage des modèles parmi ses évolutions prévues à court terme : ne la tenez pas pour acquise. Vérifiez la documentation à jour avant tout test avec des données réelles, et commencez avec des données de test ou anonymisées.

FAQ

Qu'est-ce que le coût par tâche réussie ?

C'est le coût total des appels à un modèle divisé par le nombre de tâches réussies. Il intègre les échecs, qui sont payés sans produire de résultat, ce que ne fait pas le prix au million de tokens. Il se complète utilement du coût de reprise humaine quand une erreur demande une correction.

Que dit l'annonce de Cloudflare sur Auto Router ?

Publiée le 30 septembre 2026, elle décrit un routeur en bêta publique qui choisit un modèle par requête selon la difficulté estimée et le coût, et annonce jusqu'à 30 % d'économie en usage interne. Les chiffres viennent d'un benchmark interne de 97 tâches : ils sont à lire comme ceux d'un éditeur, pas comme une mesure indépendante.

Un modèle moins cher réduit-il toujours le coût d'un agent ?

Non. S'il échoue plus souvent, chaque échec peut entraîner des relances ou une reprise humaine dont le coût dépasse l'économie réalisée sur l'appel. Le calcul dépend du prix d'un échec dans votre processus.

Faut-il utiliser un routeur de modèles dans une PME ?

Pas systématiquement. Il peut aider quand le volume est élevé et les tâches très variées, mais il rend le comportement moins reproductible. Commencez par sortir du modèle les décisions simples et par mesurer le coût par tâche réussie sur vos propres cas.

Comment tester sans se lancer dans un projet lourd ?

Réunissez 30 cas réels, définissez ce qu'est une réussite, essayez deux ou trois modèles avec les mêmes consignes et comparez le coût par tâche réussie, reprise humaine comprise. Quelques heures suffisent pour obtenir un ordre de grandeur utilisable.

Sources

Pour aller plus loin

Vous voulez savoir combien coûte réellement votre cas d'usage, et si un autre choix de modèle changerait la facture ? Décrivez-nous la tâche : nous définissons ensemble le critère de réussite, le jeu d'essai et la mesure. Notre approche part toujours d'un processus précis, et nos offres détaillent les formats d'accompagnement.