Retour d'expérience outillé
Sortir d'Anthropic en direct
ce que Back Market mesure, et ce que les autres sources en disent
Deux comptes rendus de Nicolas M sur la sortie de l'API Anthropic en direct, confrontés aux autres vidéos publiques qui parlent d'OpenRouter et à sa documentation.
Dossier documenté · Sources et mesures datées dans chaque chapitre
À retenir
- Le fait. Entre mai et août 2026, la dépense mensuelle en agents de code chez Back Market passe de 87 k$ chez Anthropic en direct à 23 k$ chez OpenRouter, pour la même population d'environ 245 développeurs.
- Le mécanisme. L'économie ne vient pas d'une remise négociée mais d'un changement de modèles consommés, couplé à un plafond de 200 $ par développeur et par mois introduit dans la même fenêtre. Les 2 leviers arrivent ensemble, aucun compte rendu ne permet de les créditer séparément.
- Ce que l'agrégateur ne fait pas. Un contrat unique avec OpenRouter simplifie l'achat. Router vers 10 providers laisse 10 politiques de données à vérifier, et OpenRouter ne répond pas de ce qui se passe chez Fireworks, Google Vertex ou Amazon Bedrock.
- Ce qu'en disent les autres sources. Stripe a annoncé le rachat d'OpenRouter, pour plus de 7 milliards de dollars selon Bloomberg ; une équipe de 200 ingénieurs l'a quitté pour Vertex AI pour des raisons de sécurité ; les modèles chinois y dépassent 60 % de l'usage en juillet 2026. La partie IV recense les vidéos concernées.
- Où approfondir. Le Claude Code Ultimate Guide intègre ces enseignements dans 4 pages, chacune rattachée à sa question, listées en partie V.
Les termes en pointillés donnent leur définition au survol, au clavier ou au toucher.
Le cas Back Market
La facture Anthropic passe de 57 k$ à 87 k$ en un mois
La dépense double presque en un mois, avant tout problème technique.
Nicolas M ouvre sur ce qu'il appelle « là où ça fait mal ». En mai 2026, environ 230 à 240 développeurs consomment 57 k$ d'API Anthropic, uniquement via Claude Code. En juin, le même périmètre passe à 87 k$.
Il parle en responsable du déploiement : « Imaginez ceci, 250 développeurs pendant 1 an qui peuvent utiliser Claude Code sans aucune limite de budget avec une facturation à l'usage. » Le rôle assigné est de déployer l'outil et de former, pendant que la dépense grimpe.
La décision est prise de quitter l'accès Anthropic en direct. L'usage d'OpenRouter démarre le 18 juin 2026, la généralisation intervient fin juillet.
La dépense mensuelle tombe de 87 k$ à 23 k$
Les 2 colonnes de facturation se lisent mois par mois, sans interruption de service pour les utilisateurs.
Nicolas M montre les 2 consoles en parallèle. La colonne Anthropic s'éteint pendant que la colonne OpenRouter monte, sur la même population d'utilisateurs.
| Mois 2026 | Anthropic en direct | OpenRouter | Commentaire |
|---|---|---|---|
| Mai | 57 k$ | pas encore utilisé | 230 à 240 utilisateurs Claude Code |
| Juin | 87 k$ | démarrage le 18 juin | Le pic qui déclenche la décision |
| Juillet | 25 k$ | 21 k$ | Le montant OpenRouter couvre le 18 juin au 31 juillet |
| Août | 574 $ | 23 k$ | Mois de référence pour toutes les analyses de la vidéo |
| Septembre | 17 $ | non communiqué | Relevé au 9 septembre environ |
À la question d'un arrêt de l'IA, il répond : « Est-ce que vous avez arrêté d'utiliser l'IA ? Non, tous ces gens-là ont été transférés sur OpenRouter. » La colonne Anthropic baisse parce que l'usage est passé sur OpenRouter.
DIAGRAMME · Avant et après la passerelle
Un contrat unique avec l'agrégateur ne transfère pas la responsabilité
La vidéo du 22 juillet 2026, antérieure au bilan, pose la contrainte juridique que les chiffres ne montrent pas.
Le bilan de septembre n'est pas le premier épisode. Le 22 juillet 2026, Nicolas M avait déjà expliqué le mécanisme, et surtout ce qu'il coûte en travail juridique. C'est la partie que les tableaux de dépense ne montrent jamais.
Son argument commercial est clair : « vous en tant qu'entreprise vous allez avoir qu'un seul contrat avec Open Router et vous n'aurez pas forcément besoin d'avoir ensuite un contrat avec tous les fournisseurs qu'il y a derrière ».
Il en tire une règle : « si vous routez vers 10 providers, vous avez 10 politiques de données à vérifier ». Il précise à l'oral qu'il s'agit bien des providers et non des modèles, corrigeant une coquille de sa propre diapositive.
| Élément | Valeur | Fiabilité |
|---|---|---|
| Providers disponibles chez OpenRouter | « à peu près 70 aujourd'hui » | Audible dans la vidéo |
| Providers retenus et autorisés par Back Market | non lisible | Le sous-titre rend le nombre par « H » |
| Providers nommés en juillet | Google Vertex, Fireworks, Amazon Bedrock | Cités explicitement |
| Providers nommés en septembre | + Microsoft Azure, Mistral | Cités explicitement |
| Providers utilisés en septembre | « une dizaine » | Audible dans la vidéo |
Le même épisode définit au passage le vocabulaire que la suite emploie : un modèle frontière l'est « parce qu'en fait c'est un modèle très puissant et qui ne peut pas tourner aujourd'hui dans votre infrastructure ou sur un provider, et c'est surtout un modèle qui est privé ».
Anthropic est alors le seul à héberger les modèles Claude. La bascule vers OpenRouter ne change pas cela. Elle n'ouvre pas Claude à d'autres hébergeurs, elle ouvre l'usage à d'autres modèles.
Pourquoi la facture baisse
GLM 5.2 absorbe 53 % des tokens pour 35 % de la facture
Back Market paie moins parce qu'il consomme d'autres modèles que ceux d'Anthropic.
En août, Nicolas M croise 2 vues de la même console, la répartition en montant dépensé et la répartition en volume de tokens. Un modèle qui pèse plus en tokens qu'en dépense coûte moins cher au token que la moyenne du mix.
| Modèle | Part des tokens | Part de la facture | Montant cité |
|---|---|---|---|
| GLM 5.2 (open weight) | 53 % | 35 % | plus de 8 k$ |
| Sonnet 5 | 8 % | non chiffré | à peine 2 k$ |
| Opus | non chiffré | non chiffré | « a pas mal disparu du radar » |
| Gemini, GPT | « loin derrière » | non chiffré | non chiffré |
GLM 5.2 est à la fois le modèle le plus utilisé et, selon ses mots, « le modèle aussi qui va coûter le plus cher » parmi ceux qui portent le volume. Mais quand on trie par argent plutôt que par tokens, Sonnet et Opus remontent dans le classement malgré leur faible volume.
D'où sa conclusion : « les modèles d'Anthropic sont vraiment vraiment chers, même quand vous passez par OpenRouter ».
Il prend soin de ne pas surinterpréter la disparition d'Opus : « le coût a été réduit pas parce qu'on s'en sert moins mais parce que simplement on a accès à plus de providers ». Il répond aussi à l'objection productivité : « les utilisateurs n'ont pas perdu soudainement leur productivité ou leur usage ».
Vitesse : plus rapides sur les tâches simples, moins bons sur les longues
La vitesse est pour lui un critère sous-estimé : « les modèles d'OpenAI sont plus rapides. Le nombre de tokens par seconde qui sont générés par ces modèles sont plus rapides et une session de travail va prendre moins de temps parce que vous allez moins attendre. » Même impression sur GLM 5.2.
Sur des tâches complexes et longues, il constate que ces modèles « tirent un peu la patte » ou « font un peu n'importe quoi », et « restent quand même moins bons en terme d'intelligence que les modèles Anthropic ». Sur des tâches simples en revanche, « ça marche super bien ».
Back Market segmente donc l'usage par difficulté de tâche.
Une équipe dont la charge est majoritairement complexe ne devrait pas attendre le même facteur. Le guide AI Unit Economics détaille ce routage par complexité et ses risques, dont la perte du cache quand le modèle change en cours de tâche.
Les tarifs publics confirment un rapport de 5,7 entre GLM 5.2 et Opus 4.8
Le catalogue OpenRouter au 16 septembre 2026 permet de contrôler les ordres de grandeur avancés.
Aucun accès à la console de Back Market n'est nécessaire. Le catalogue OpenRouter est public et non authentifié, et son affirmation sur le prix des modèles Anthropic s'y vérifie.
| Identifiant | Entrée | Sortie | Rapport sortie vs GLM 5.2 |
|---|---|---|---|
z-ai/glm-5.3-flash | 0,09 $ | 0,30 $ | 0,07 |
z-ai/glm-5.2 | 1,40 $ | 4,40 $ | référence |
anthropic/claude-haiku-4.5 | 1,00 $ | 5,00 $ | 1,1 |
anthropic/claude-sonnet-5 | 2,00 $ | 10,00 $ | 2,3 |
anthropic/claude-opus-4.8 | 5,00 $ | 25,00 $ | 5,7 |
z-ai/glm-5.3-flash. Entre 2 modèles open weight de la même famille, l'écart de prix dépasse celui qui sépare GLM 5.2 de Sonnet 5.Une dizaine de providers et une ventilation automatique au prix du token
Ce que la passerelle fait à la place de l'équipe, et ce qu'elle ne fait pas.
Back Market travaille avec une dizaine de providers, dont Microsoft Azure, Amazon Bedrock, Google, Fireworks et Mistral. Nicolas M note que Mistral héberge aussi du GLM 5.2 : « vous pouvez aller taper sur l'infrastructure Mistral » pour consommer un modèle chinois depuis une infrastructure européenne.
Sa définition, pour qui confond les 2 niveaux : « un provider c'est comme un hébergeur internet qui aurait plein de sites internet, et chaque site internet en fait ce sont les fameux modèles ».
DIAGRAMME · Ce que la passerelle arbitre
Il décrit l'arbitrage : « cette ventilation, elle est faite automatiquement par OpenRouter selon aussi le prix du token. Parfois c'est plus intéressant d'aller chercher chez Microsoft un accès à OpenAI que de l'avoir en direct, et parfois c'est l'inverse. » Le bénéfice qu'il retient est opérationnel plus que financier : « moi, en tant qu'utilisateur, j'ai pas besoin de m'ennuyer ».
Côté OpenRouter, ces contraintes passent par des paramètres de routage documentés. zdr: true limite une requête aux endpoints sans rétention de données, data_collection: "deny" écarte les providers qui conservent des données. La liste only restreint le routage à des providers nommés, à l'intérieur de ceux autorisés au niveau du compte. C'est l'équivalent technique de la liste courte de Back Market décrite en partie I. Par défaut, OpenRouter répartit la charge en favorisant les providers les moins chers, pondérés par l'inverse du carré de leur prix. Source : documentation du routage par provider.
Rendre un poste de travail indépendant d'un fournisseur de modèles demande davantage qu'une URL de passerelle. L'article « Portability becomes a Scale concern » décrit ce qui survit à une migration contrôlée d'un fournisseur à l'autre.
Le blended cost par million de tokens recule de 13 % en un mois
L'indicateur unique que Nicolas M retient pour piloter, et ce qu'il prouve exactement.
Sa métrique préférée s'affiche en haut à droite de la console OpenRouter, le blended dollar per million. Entre juillet et août, il recule de 13 %.
Son interprétation : « mes utilisateurs pour un million de tokens ont payé moins cher que le mois d'avant, et je suppose que du coup ils ont utilisé des modèles moins chers. Pour mesurer l'efficience d'une entreprise et de 245-250 utilisateurs, c'est plutôt un bon indicateur. »
Au niveau de la tâche, le même angle mort existe. Inferya compare 2 modèles qui coûtent chacun 0,07 $ par tentative sur SWE-bench Verified, avec le harnais mini-SWE-agent : l'un résout 75,8 % des tâches, l'autre 9 %. Rapporté aux tâches résolues, le premier revient à 0,092 $ par tâche et le second à 0,778 $, soit 8,4 fois plus.
Un blended cost proche peut donc cacher des coûts par tâche résolue très différents.
La FinOps Foundation formalise ces indicateurs, du coût par token au coût par inférence et par appel d'API, dans son guide « FinOps for AI » mis à jour le 17/02/2026. L'article « Mapping the token-reduction toolbox » applique la même prudence aux outils de réduction de tokens. Une sortie plus courte ne suffit pas à prouver qu'une tâche terminée coûte moins cher.
Nicolas M présente d'ailleurs cette baisse comme une inférence, pas comme une mesure. Le verbe qu'il emploie est « je suppose ».
Le pilotage budgétaire
200 $ par développeur et par mois, avec 3 issues en cas d'épuisement
Le levier que la passerelle n'apporte pas, et que Nicolas M présente comme co-responsable du résultat.
Le budget se remet à zéro à la fin du mois. Interrogé sur la suffisance des 200 $, il répond : « Oui, les gens le prouvent aujourd'hui. »
DIAGRAMME · Le parcours d'un développeur qui épuise sa dotation
- Extension auto-servie de 20 $
Demandable depuis Slack à n'importe quelle heure, « parce que c'est pas un humain qui va approuver votre demande ». Elle exige de remplir un formulaire avec des chiffres relevés dans la console OpenRouter : nombre de sessions, session la plus coûteuse, répartition par modèle. Elle n'est accordée qu'une seule fois : « si j'éclate ces 20 dollars, j'aurai pas le droit à 240 dollars, ça s'arrêtera là ».
- Exception projet arbitrée en comité
Le manager remplit un formulaire Confluence avec une estimation du montant nécessaire. Un comité, mêlant tenue du budget et profils produit, vérifie que la demande « va générer du business ». Délai annoncé : environ une demi-journée. Résultat : un workspace OpenRouter dédié, hors dotation individuelle.
- Clés dédiées pour les traitements automatisés
Les agents non humains, revue de pull request, tâches de CI, bots Slack, fonctionnalités produit, ont leurs propres clés avec un modèle imposé, et ne consomment pas la dotation d'un développeur.
L'intention du formulaire est pédagogique, pas punitive : « c'est pour que les gens puissent comprendre un peu où est parti l'argent et qu'ils puissent se poser les bonnes questions, et que nous en fait on n'ait pas besoin de leur expliquer à chaque fois qu'est-ce que c'est qu'un modèle, qu'est-ce que c'est qu'une session. » Il ajoute que c'est « super bien accepté par nos collaborateurs ».
Sa propre session à 190 $ sert d'exemple
Plutôt que d'exposer un collègue, Nicolas M se nomme. Il montre une session des 13-14 août à 190 $ sur un seul run. « Vous êtes motivé et vous faites ça. »
| Modèle | Coût |
|---|---|
| Opus 4.8 | 139 $ |
| Opus 5 | 8 $ |
| Sonnet 5 | 5 $ |
| Reste | négligeable |
Un seul modèle porte 73 % de la session. Le formulaire demande la répartition par modèle, ce qui rend cet écart visible : « je prends conscience qu'il y a des modèles qui font mal ».
Le guide AI Unit Economics distingue les politiques de budget selon qui dépense. Un agent, une tâche de CI ou un service sans surveillance appellent un plafond strict, faute de personne pour lire une alerte. Un développeur en session peut recevoir une alerte, puis passer par une approbation.
Les exceptions rattachent chaque dépense à un projet nommé
Ce que Nicolas M valorise le plus dans le dispositif, et qui n'apparaît dans aucun des chiffres précédents.
Il cite des montants rattachés à des projets : « on sait qu'on a mis 1100 € sur ce petit projet là qui est important, et que ce hackathon là finalement a coûté que 38 dollars et pas 500 dollars ».
Le même raisonnement s'applique aux agents automatisés, avec une contrainte supplémentaire : « si jamais un système commence à faire n'importe quoi et à dépenser plein d'argent, grâce à OpenRouter on peut très facilement contrôler ça, mettre de l'alerting dessus ».
Sa conclusion élargit volontairement le sujet : « je sais que je parle beaucoup d'OpenRouter, mais au-delà d'OpenRouter, ce que je voudrais vous montrer c'est comment on fait pour que la valeur que génère l'intelligence artificielle, on s'assure que cette valeur est là ». Il ajoute un argument non financier : « quand on voit des tokens et la finance, faut réfléchir que ça a un certain coût en énergie ».
Ce qu'en disent les autres sources
75 vidéos publiques parlent d'OpenRouter, 12 apportent un fait nouveau
Retours d'usage, lecture du marché et mise en pratique, tout ce qui complète, nuance ou contredit le cas Back Market.
Entre 2025 et septembre 2026, 75 vidéos publiques mentionnent OpenRouter, sur des chaînes techniques francophones et anglophones. La plupart le citent au passage ; 12 apportent un fait, un chiffre ou un retour d'expérience.
Pour une vue d'ensemble du marché, OpenRouter et a16z ont publié le 04/12/2025 un rapport « State of AI » fondé sur plus de 100 000 milliards de tokens routés en un an. Il constate que l'adoption des modèles open weight s'est accélérée et qu'ils servent désormais de briques pour des applications en production.
Les 12 vidéos retenues
| Angle | Date | Chaîne | Vidéo | Ce qu'elle apporte |
|---|---|---|---|---|
| Retours d'usage | 14/09/2026 | Nicolas Martignole | Bilan de 2 mois avec OpenRouter, pour 245 utilisateurs : les vrais chiffres | Bilan de la bascule : 87 k$ par mois chez Anthropic en juin, 23 k$ chez OpenRouter en août, pour environ 245 développeurs, avec le dispositif budgétaire associé. |
| Retours d'usage | 22/07/2026 | Nicolas Martignole | Claude Max (abo prix fixe) ou API (pay-as-you-go): ce n'est pas une question de prix | Environ 70 providers disponibles, une liste courte autorisée par Back Market, et une responsabilité qui reste au client. |
| Retours d'usage | 11/07/2026 | Nicolas Martignole | Le vrai coût de l'IA : pourquoi le prix au token est faux | D'après une présentation du COO d'OpenRouter, les modèles chinois y dépassent les modèles américains en volume ; Nicolas M en conclut que le prix au token induit en erreur. |
| Retours d'usage | 30/06/2026 | Nicolas Martignole | Premiers benchmarks avec Sonnet 5, et comparo avec GLM 5.2 | Évaluation d'OpenRouter pour obtenir un contrat unique, et providers testés : Google Vertex, Amazon Bedrock, Fireworks. |
| Retours d'usage | 29/05/2026 | AI Native Dev | How We Built an AI Code Reviewer for 200 Engineers | Une équipe de 200 ingénieurs démarre sur OpenRouter (une seule API, mêmes prix que les éditeurs) puis passe sur Vertex AI : certains modèles ne respectaient pas ses règles de sécurité, et Vertex lui donne plus de contrôle sur les journaux et les budgets. |
| Marché | 17/08/2026 | Bloomberg | Anthropic's Revenue Jump, The Wealthy Bet on SpaceX · Bloomberg Tech | Stripe rachèterait OpenRouter pour plus de 7 milliards de dollars, selon les sources de Bloomberg. |
| Marché | 22/08/2026 | Bloomberg | Chinese AI Models Gain Ground on US AI in Price and Use | Les données d'usage d'OpenRouter montrent plus de 60 % de modèles chinois en juillet 2026. Réserve explicite : OpenRouter n'est qu'une plateforme, et l'usage direct des API Anthropic et OpenAI n'y est pas visible. |
| Marché | 06/08/2026 | AI Engineer | The State of Model Routing — NVIDIA, Cognition, OpenRouter | Table ronde avec un représentant d'OpenRouter, NVIDIA et Cognition sur le routage : envoyer chaque tâche au plus petit modèle suffisant, et orchestrer plusieurs modèles ensemble. |
| Marché | 23/04/2026 | The Product Crew | Tech @ France : Comment l’État français déploie sa propre stack IA | L'État français présente OpenGateLLM, sa passerelle d'inférence open source, comme alternative à LiteLLM et OpenRouter. |
| Mise en pratique | 04/06/2026 | Cole Medin | Claude Plans, Gemini Designs: The Workflow to Build BEAUTIFUL Frontends | Claude planifie, Gemini 3.5 Flash conçoit l'interface : l'accès à Gemini passe par OpenRouter depuis l'agent Pi. |
| Mise en pratique | 06/04/2026 | The Next New Thing | Best & cheapest AI for OpenClaw | Configurer un agent avec des modèles moins chers via OpenRouter : quelques dollars de crédit, puis comparaison de modèles jusqu'au choix de GLM 5.1. |
| Mise en pratique | 15/06/2025 | Alex so yes | Tutoriel Complet : Coder une app entière avec Cline (OpenSource) | OpenRouter comme interface unique qui masque les différences de format d'API entre éditeurs, avec son classement des modèles les plus utilisés. |
Les 75 vidéos qui mentionnent OpenRouter
Ce que le guide Claude Code en retient
4 pages du Claude Code Ultimate Guide intègrent ces enseignements
Chaque enseignement rejoint la page du guide qui traite déjà sa question.
Le Claude Code Ultimate Guide couvrait déjà la question des passerelles, mais de façon dispersée, et avec une contradiction entre 2 pages. L'une déconseillait de pointer Claude Code vers un autre backend en production, l'autre recommandait exactement ce mécanisme.
Les enseignements de ce document y sont intégrés page par page, sans répéter un même chiffre à 2 endroits.
| Question | Page du guide | Ce qu'elle retient du cas Back Market |
|---|---|---|
| Comment plafonner et attribuer la dépense des développeurs ? | API Gateway, Model Allowlists | Le plafond à 200 $ par mois avec extension auto-servie ; environ 70 providers disponibles et une dizaine utilisés ; la règle des 10 providers, 10 politiques de données ; la responsabilité qui reste au client |
| Licences nominatives, identités de service, ou les 2 ? | Subscription Strategy, section 6 | Le passage de 87 k$ à 23 k$ par mois, avec la réserve que 2 leviers ont agi ensemble |
| Pointer Claude Code ailleurs est-il légitime ? | Pointing Claude Code at Another Backend | La distinction entre une passerelle commerciale sous contrat et un proxy rétro-ingénieré, l'avertissement restant entier sur le second |
| Quel matériel, et combien coûte un token servi ? | Local vs Cloud Inference | Un tableau de renvoi vers la page qui traite chaque question |
2 autres pages du guide prolongent le sujet sans reprendre le cas Back Market : AI Unit Economics, sur le coût par tâche acceptée, et Team Metrics, sur les métriques des équipes qui travaillent avec des agents.
Reproduire la mesure
Comparer 2 modèles sur des tâches réelles, via l'API OpenRouter
Un protocole minimal teste la substitution de modèles avant de toucher à la configuration d'une équipe.
La substitution de modèles se teste en premier. Elle ne demande ni passerelle d'équipe ni plafond. Le test porte sur un petit lot de tâches réelles et figées, 5 à 10 demandes représentatives du travail courant, envoyées à l'identique à 2 modèles.
Le test le plus direct branche Claude Code lui-même sur OpenRouter. Le guide d'intégration officiel tient en 3 variables d'environnement, sans proxy local, à placer dans le profil du shell ou dans le fichier .claude/settings.local.json du projet.
Terminal Brancher Claude Code sur OpenRouter 4 lignes
export OPENROUTER_API_KEY="sk-or-..."
export ANTHROPIC_BASE_URL="https://openrouter.ai/api"
export ANTHROPIC_AUTH_TOKEN="$OPENROUTER_API_KEY"
export ANTHROPIC_API_KEY="" # doit être vide, et non absenteSi Claude Code était déjà connecté à un compte Anthropic, lancer /logout une fois et relancer. La commande /status doit ensuite afficher https://openrouter.ai/api sur la ligne de l'URL de base. Cette URL ne prend pas de suffixe /v1, réservé à l'API compatible OpenAI, qui provoque des erreurs de modèle introuvable.
Pour une comparaison contrôlée hors de Claude Code, la première étape consiste à lister les identifiants disponibles plutôt que recopier un nom vu dans une vidéo. Le catalogue est public et ne demande aucune authentification.
Terminal Lister les modèles et leur tarif, trié par prix de sortie 10 lignes
curl -s https://openrouter.ai/api/v1/models -o or-models.json
python3 - or-models.json <<'PY'
import json, sys
rows = json.load(open(sys.argv[1]))["data"]
for m in sorted(rows, key=lambda x: float(x["pricing"]["completion"])):
p = m["pricing"]
print("%-44s in=%7.2f $/M out=%8.2f $/M" % (
m["id"], float(p["prompt"]) * 1e6, float(p["completion"]) * 1e6))
PYLa réponse contient data, total_count et links ; chaque entrée porte id, pricing.prompt, pricing.completion et context_length. Au 16 septembre 2026, le catalogue compte 443 entrées. Les identifiants préfixés d'un ~ sont des alias qui suivent la dernière version d'une famille : pratiques pour explorer, à éviter pour comparer, puisque leur cible peut changer entre 2 passes.
Deuxième étape, envoyer la même demande aux 2 modèles. La commande suivante lit la demande dans prompt.txt et enregistre chaque réponse dans un fichier distinct, depuis n'importe quel dossier de travail.
Terminal Même demande, 2 modèles (nécessite curl et jq) 10 lignes
export OPENROUTER_API_KEY='sk-or-...'
for model in anthropic/claude-sonnet-5 z-ai/glm-5.2; do
jq -n --arg m "$model" --rawfile p prompt.txt \
'{model: $m, messages: [{role: "user", content: $p}]}' \
| curl -s https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d @- > "reponse-${model//\//_}.json"
done/api/v1/chat/completions proviennent de la documentation d'OpenRouter, consultée le 16 septembre 2026. L'appel de complétion lui-même n'a pas été exécuté pour ce document, faute de clé créditée. Vérifier la structure d'une première réponse avant d'automatiser la lecture des suivantes.Troisième étape, comparer sur des critères vérifiables plutôt qu'à l'impression : la réponse est-elle exploitable sans reprise, le code compile-t-il, les tests passent-ils. Rapporter ensuite la consommation de tokens de chaque passe au tarif relevé à la première étape.
Sans ce décompte, on ne sait pas si le modèle moins cher le reste une fois les reprises comptées. Le guide AI Unit Economics explique comment construire cette comparaison par paires, et ce qu'un petit échantillon permet de conclure.
Reproduire le plafond par personne avec une clé à limite de crédit
Le mécanisme des 200 $ est une fonctionnalité documentée d'OpenRouter, testable seul.
La dotation individuelle de Back Market repose sur une capacité documentée de l'API de gestion. Une clé peut porter son propre plafond de crédit.
| Besoin | Élément | Vérifié |
|---|---|---|
| Point d'entrée | https://openrouter.ai/api/v1 | oui, Quickstart |
| Authentification | En-tête Authorization: Bearer <clé> | oui, Quickstart |
| Appel de complétion | POST /api/v1/chat/completions | oui, Quickstart |
| Catalogue et tarifs | GET /api/v1/models | oui, appelé en direct |
| Plafond par clé | POST /api/v1/keys, champ limit | oui, doc Provisioning |
| Remise à zéro du plafond | Quotidienne, hebdomadaire ou mensuelle, par clé | oui, page Enterprise |
Sur sa page Enterprise, OpenRouter documente des plafonds de crédit par clé avec remise à zéro automatique, quotidienne, hebdomadaire ou mensuelle. Une clé par développeur avec une remise mensuelle reproduit donc la dotation de 200 $ par mois de Back Market, sans comptabilité maison.
POST /api/v1/keys n'a pas été appelé pour ce document. Cette opération crée une ressource facturable et exige une clé de provisioning. L'existence du champ limit (« Optional credit limit ») vient de la documentation, pas d'une exécution. Le comportement exact à l'atteinte du plafond, code d'erreur et message renvoyés au client, reste à observer avant de bâtir un process dessus.Pour un test individuel, reproduire le formulaire à 3 questions ne dépend d'aucune API. Après une semaine d'usage, répondre soi-même : combien de sessions, quelle a été la session la plus coûteuse, et quelle est la répartition par modèle. Nicolas M lui attribue un effet pédagogique, et il se teste sans budget.
Protocole minimal sur 2 semaines
- Semaine 1, mesurer sans rien changer
Basculer l'usage courant sur une clé OpenRouter dédiée, sans plafond et sans changer de modèle. L'objectif est d'obtenir une ligne de base et un blended cost de départ.
- Fin de semaine 1, répondre au formulaire
Les 3 questions, sur sa propre console. Noter la réponse avant de regarder la semaine suivante. C'est la mesure de l'effet pédagogique, et elle disparaît si on la reconstitue après coup.
- Semaine 2, segmenter par difficulté
Router explicitement les tâches simples vers un modèle bon marché et garder le modèle haut de gamme pour les tâches complexes, selon la coupure que Nicolas M décrit. Cette semaine teste la segmentation.
- Comparer les 2 blended costs
L'écart entre les 2 semaines est l'équivalent individuel des 13 % observés chez Back Market. À volume très différent d'une semaine à l'autre, l'indicateur reste comparable puisqu'il est ramené au million de tokens, mais la facture totale, elle, ne l'est pas.
Ce que ce retour d'expérience ne démontre pas
Transposer le facteur observé demande 4 précautions.
Les chiffres de population varient dans la vidéo elle-même : le titre annonce 245 utilisateurs, l'introduction parle de 250, le premier écran Anthropic de 230 à 240. Nicolas M les emploie de façon interchangeable pour désigner la même population. Ce document conserve ses formulations plutôt que d'harmoniser un chiffre qu'il n'a pas arrêté.
Glossaire
Les termes utilisés dans ce dossier.
- Blended cost
- Prix moyen payé pour un million de tokens sur une période, tous modèles confondus. OpenRouter l'affiche sur sa console. À volume constant, il baisse quand les utilisateurs se déplacent vers des modèles moins chers.
- Open weight
- Modèle dont les poids sont publiés, donc hébergeable par n'importe quel provider. À distinguer d'un modèle propriétaire, accessible uniquement chez son éditeur.
- Provider
- Hébergeur qui sert un modèle. Un même modèle open weight peut être servi par plusieurs providers, à des prix différents.
- Zero data retention
- Engagement d'un provider à ne conserver aucune donnée de requête. Critère de sélection cité pour écarter des modèles pourtant bien classés. Abrégé ZDR.
Les autres termes du glossaire
- BYOK
- Bring Your Own Key : utiliser ses propres clés ou crédits chez un fournisseur de modèles à travers une passerelle. OpenRouter applique alors un barème de frais distinct.
- Claude Code
- Agent de développement en ligne de commande édité par Anthropic. Il consomme soit l'API Anthropic en direct, soit une passerelle compatible.
- GLM
- Famille de modèles open weight publiée par Z.ai. GLM 5.2 est le modèle le plus consommé dans le retour d'expérience décrit ici.
- Modèle frontière
- Modèle privé, trop lourd pour tourner chez un tiers ou sur une infrastructure interne, servi uniquement par son éditeur. Les modèles Claude en font partie.
- OpenRouter
- Passerelle commerciale qui expose plusieurs centaines de modèles derrière une seule API et une seule facture, et répartit les requêtes entre providers.
- Passerelle
- Service intermédiaire entre un client et plusieurs fournisseurs de modèles. Elle centralise l'authentification, la facturation et le routage. On dit aussi gateway.
- Token
- Unité de découpage du texte facturée par les fournisseurs. Les prix sont exprimés par million de tokens, séparément en entrée et en sortie.
- Workspace
- Espace de facturation isolé dans OpenRouter. Utilisé ici pour sortir un budget projet de la dotation individuelle d'un développeur.
Conclusion, sources et mises à jour
Périmètre et méthode du dossier
Ce document part de 2 vidéos de Nicolas M, publiées le 22 juillet et le 14 septembre 2026, qui décrivent la migration d'environ 245 développeurs de l'accès Anthropic direct vers la passerelle OpenRouter, puis le dispositif budgétaire qui l'accompagne. Il les confronte à d'autres vidéos publiques qui parlent d'OpenRouter, à la documentation et aux tarifs d'OpenRouter, et renvoie vers les pages du Claude Code Ultimate Guide qui traitent chaque question. Les citations proviennent des sous-titres, automatiques pour la plupart, qui écorchent les noms propres. Les noms de modèles ont été rétablis quand ils étaient certains, et signalés quand ils ne l'étaient pas. Les tarifs OpenRouter ont été relevés sur l'API publique le 16 septembre 2026. Ce document ne mesure ni la qualité du code produit, ni le temps passé par les développeurs. Il porte sur une dépense, et sur la traçabilité de cette dépense.
Conclusion
La bascule vers une passerelle et le plafond par personne sont 2 décisions distinctes, que Nicolas M présente comme conjointes. La passerelle ouvre l'accès à d'autres modèles et détaille la dépense par modèle ; le plafond limite ce que chaque développeur engage. La vidéo ne permet pas de dire quelle part de la baisse revient à chacune.
Le dispositif transposable le moins coûteux est le formulaire à 3 questions exigé avant l'extension de 20 $. Il oblige le développeur à relire sa propre console avant de dépenser davantage. Il ne demande ni passerelle ni budget, et se teste seul, sur son propre usage.
Sources datées
- Bilan de 2 mois avec OpenRouter, pour 245 utilisateurs : les vrais chiffres, Nicolas Martignole · 14 septembre 2026 · Source documentaire
- OpenRouter, Quickstart : URL de base, en-tête d'authentification et endpoints · 16 septembre 2026 · Observation vérifiée
- OpenRouter, Provisioning API Keys : création de clés avec plafond de crédit · 16 septembre 2026 · Observation vérifiée
- OpenRouter, catalogue public des modèles et tarifs (443 modèles au relevé) · 16 septembre 2026 · Observation vérifiée
- Claude Max (abo prix fixe) ou API (pay-as-you-go), ce n'est pas une question de prix, Nicolas Martignole · 22 juillet 2026 · Source documentaire
- The State of Model Routing, NVIDIA, Cognition, OpenRouter, AI Engineer · 6 août 2026 · Source documentaire
- How We Built an AI Code Reviewer for 200 Engineers, AI Native Dev · 29 mai 2026 · Source documentaire
- Anthropic's Revenue Jump, The Wealthy Bet on SpaceX · Bloomberg Tech, Bloomberg · 17 août 2026 · Source documentaire
- Chinese AI Models Gain Ground on US AI in Price and Use, Bloomberg · 22 août 2026 · Source documentaire
- Tech @ France : Comment l’État français déploie sa propre stack IA, The Product Crew · 23 avril 2026 · Source documentaire
- Le vrai coût de l'IA : pourquoi le prix au token est faux, Nicolas Martignole · 11 juillet 2026 · Source documentaire
- Claude Code Ultimate Guide, API Gateway · 16 septembre 2026 · Source documentaire
- Stripe, annonce de l'accord d'acquisition d'OpenRouter · 19 août 2026 · Observation vérifiée
- OpenRouter, routage par provider : zdr, data_collection, only et ignore · 17 septembre 2026 · Observation vérifiée
- OpenRouter, offre Enterprise : plafonds par clé, ZDR, verrouillage régional · 17 septembre 2026 · Observation vérifiée
- OpenRouter, tarifs : frais de plateforme et BYOK · 17 septembre 2026 · Observation vérifiée
- OpenRouter, guide d'intégration de Claude Code · 17 septembre 2026 · Observation vérifiée
- OpenRouter et a16z, The 2025 State of AI Report · 4 décembre 2025 · Observation vérifiée
- Superconductor, Kimi K3 benchmark sur un SWE-bench interne · 3 août 2026 · Observation vérifiée
- Inferya, coût par tâche résolue des benchmarks d'agents · 21 août 2026 · Observation vérifiée
- FinOps Foundation, FinOps for AI Overview · 17 février 2026 · Observation vérifiée
La mention « consulté le » indique la date de lecture. Une source peut avoir été publiée plus tôt, puis modifiée.
Historique des mises à jour
| Date | Version | Ajouts |
|---|---|---|
| 18 septembre 2026 | 2.8.0 | Passe de rythme et de redites sur les 2 langues : 24 deux-points d'annonce repassés en phrases, 7 paragraphes ouverts par « Sur » rendus à leur sujet, 5 chapeaux de chapitre repassés au verbe conjugué, 6 paragraphes scindés pour créer des ruptures courtes. Redites supprimées : les montants de la comparaison mensuelle rejoués dans un encadré, 2 citations reprises mot pour mot d'une section à l'autre, l'annonce en partie II d'une session détaillée en partie III, et les définitions du glossaire répétées dans le corps. |
| 17 septembre 2026 | 2.6.0 | Compléments vérifiés sur sources primaires : annonce officielle du rachat par Stripe, paramètres de routage et plafonds par clé d'OpenRouter, frais de plateforme, branchement de Claude Code sur OpenRouter et sa réserve officielle, mesures de qualité et de coût par tâche de Superconductor et d'Inferya, guide FinOps for AI. Liens vers les pages AI Unit Economics et Team Metrics du guide et vers 2 articles publiés du blog. Dates au format JJ/MM/AAAA. |
| 17 septembre 2026 | 2.5.0 | Montants en notation k$, liens vers les entreprises et produits cités à leur première mention, lien vers le profil de l'intervenant, citations mises en évidence, bouton de copie sur les commandes et menu « Autres ressources ». |
| 16 septembre 2026 | 2.4.0 | Coloration syntaxique des commandes et liens vers le portfolio, le Claude Code Ultimate Guide et GitHub dans le menu. |
| 16 septembre 2026 | 2.3.0 | Relecture éditoriale complète : suppression des tournures d'opposition répétées, des intertitres de signalisation et des chutes sentencieuses ; titres réécrits pour énoncer le fait ; légendes des infographies remplacées par leur source et leur date. 4 affirmations qui dépassaient la source ont été corrigées, dont l'idée qu'aucun des 2 leviers ne suffirait seul, que la vidéo n'établit pas. |
| 16 septembre 2026 | 2.2.0 | Ajout de 5 infographies : responsabilité contractuelle, écart tokens contre facture, baisse de la facture mensuelle, portée du blended cost, formulaire à 3 questions. Chaque image repose sur un fait déjà établi dans le document ; ses textes et ses proportions ont été contrôlés un par un. Corrections de formulation : un reste d'impératif et des propos oraux présentés comme écrits. |
| 16 septembre 2026 | 2.1.0 | Document rendu consultable par tout lecteur : liste complète des vidéos qui mentionnent OpenRouter et sélection commentée de 12 d'entre elles, renvois vers les pages publiques du guide, protocole de test réécrit sur l'API OpenRouter seule. Retrait des éléments propres à l'environnement de l'auteur. |
| 16 septembre 2026 | 2.0.0 | Périmètre élargi : vidéo du 22 juillet 2026 et contrainte de responsabilité qu'elle pose, comparaison avec d'autres vidéos publiques, renvois vers le Claude Code Ultimate Guide. Le décompte des providers autorisés reste une réserve ouverte et non une donnée établie. |