Ce que ça coûte
à partir de combien de tokens par mois l'auto-hébergement d'un llm coûte moins cher que l'api claude
Script de reproduction · claude-vs-hetzner-breakeven.mjs · mis à jour le 2026-08-24
Toutes les affirmations du type « l'auto-hébergement devient rentable au-delà de X tokens » que vous trouvez en ligne donnent un seul chiffre et masquent les deux hypothèses qui le déterminent : le palier de modèle, et la proportion d'entrées par rapport aux sorties que traite réellement le workload. Changez l'une ou l'autre, et le chiffre se déplace de plus de 2x. Voici l'arithmétique avec les deux hypothèses explicitées, appliquée à un serveur réel à coût fixe et aux tarifs API Anthropic actuels publiés, pour que vous puissiez entrer votre propre ratio plutôt que de faire confiance au nôtre.
Le chiffre
Pour un workload Claude Sonnet 5 avec un ratio entrée/sortie de 3:1, profil courant d'un agent RAG ou tool-calling qui lit plus de contexte qu'il n'écrit, le point de breakeven face à un serveur GPU dédié Hetzner GEX44 (RTX 4000 SFF Ada, 20 Go de VRAM, 184 €/mois, soit environ 215 $/mois au taux de référence ECB EUR/USD du moment) se situe à environ 53,8 millions de tokens par mois. En dessous de ce volume, appeler l'API Claude coûte moins cher que de faire tourner et entretenir ce serveur. Au-dessus, le coût fixe mensuel du serveur l'emporte sur le seul poste tokens.
Ce chiffre unique est la partie la moins utile de cette page. Passez à Claude Haiku 4.5 avec le même ratio 3:1 et le breakeven monte à environ 107,6 millions de tokens par mois, car le prix au token de Haiku est une fraction de celui de Sonnet. Passez à Claude Opus 5 et il descend à environ 21,5 millions, car Opus coûte 2,5x le prix de Sonnet aussi bien en entrée qu'en sortie. Maintenir Sonnet 5 mais passer le ratio de 1:1 (échange de type chat) à 10:1 (agent à fort contexte) fait passer le breakeven de 35,9 millions à 78,9 millions de tokens par mois, soit un écart de 2,2x dû au seul ratio. Quiconque vous cite un chiffre de breakeven unique sans préciser le palier de modèle ni le ratio cite un nombre inventé, pas calculé.
Méthode
La comparaison fixe une variable de chaque côté. Côté auto-hébergement, un serveur GPU dédié Hetzner GEX44 : 184 €/mois, publié dans la matrice de serveurs GPU de Hetzner, capable de faire tourner un modèle open source jusqu'à environ 32 milliards de paramètres en quantisation 4 bits avec de la marge pour l'OS et le serveur d'inférence. Ce montant en euros est converti en dollars au taux de référence ECB publié (1,1699 le 2026-08-21) pour être mis en regard du tarif API Anthropic libellé en USD, soit un coût fixe mensuel d'environ 215,26 $.
Côté API, Anthropic publie le tarif par million de tokens séparément pour les tokens d'entrée et de sortie, avec un écart de 5x sur chaque palier de modèle actuel : 1 $ en entrée / 5 $ en sortie pour Haiku 4.5, 2 $ en entrée / 10 $ en sortie pour Sonnet 5, 5 $ en entrée / 25 $ en sortie pour Opus 5. Comme une vraie requête mêle les deux, la comparaison nécessite un prix mixte par million de tokens, calculé par (ratio * inputPrice + outputPrice) / (ratio + 1) où le ratio est le nombre de tokens d'entrée par token de sortie. Un ratio 1:1 correspond à un échange de chat bref. Un ratio 3:1 est une recherche RAG modérée : du contexte récupéré, une réponse ciblée. Un ratio 10:1 est un tour d'agent lourd : un long system prompt, plusieurs définitions d'outils, des documents récupérés, et une réponse finale ou un tool call comparativement court.
Le volume de breakeven en millions de tokens par mois est alors le coût fixe mensuel divisé par le prix mixte par million de tokens. C'est une division pure sur des chiffres publics : aucun échantillon de trafic, aucune donnée client, aucune simulation probabiliste. Le calcul complet tourne dans l'artefact lié à cette page et se reproduit à l'identique sur n'importe quelle machine avec Node installé, ce qui en fait aussi une base plus honnête qu'une page marketing d'éditeur : vous pouvez le relancer avec votre propre ratio et votre propre taux de change le jour où vous lisez ceci.
Données brutes
Hetzner GEX44: EUR184/mo -> $215.26/mo (EUR/USD 1.1699, ECB 2026-08-21)
model | input$/MTok | output$/MTok | R=1:1 | R=3:1 | R=10:1
-------------|-------------|--------------|--------|--------|--------
Haiku 4.5 | 1.00 | 5.00 | 71.8M | 107.6M | 157.9M
Sonnet 5 | 2.00 | 10.00 | 35.9M | 53.8M | 78.9M
Opus 5 | 5.00 | 25.00 | 14.4M | 21.5M | 31.6M
Lisez chaque cellule ainsi : pour ce palier de modèle et ce ratio entrée/sortie, ce nombre de millions de tokens par mois (entrées plus sorties cumulées) est le point où un seul Hetzner GEX44 cesse d'être l'option la plus coûteuse. Les trois lignes de modèle ne bougent pas indépendamment : le breakeven d'Opus 5 est exactement 2,5x plus bas que celui de Sonnet 5 à chaque ratio, parce qu'Anthropic tarifie Opus exactement 2,5x Sonnet aussi bien en entrée qu'en sortie. Si votre tableau de bord de consommation rapporte le total de tokens sans distinguer entrées et sorties, partez d'une valeur entre les colonnes 3:1 et 10:1 pour un workload agent typique ; n'utilisez la colonne 1:1 que pour de courts échanges conversationnels avec peu de contexte récupéré.
Ce que ces chiffres ne disent pas
Ce calcul porte sur le coût des tokens, pas sur le coût total de possession, et confondre les deux mène à une mauvaise décision. Un GEX44 qui fait tourner un modèle open source 32B en quantisation 4 bits n'est pas un substitut direct de Sonnet 5 ou Opus 5 sur la qualité de raisonnement, le suivi d'instructions, ou la fiabilité du tool calling : le volume de breakeven indique quand le poste infrastructure bascule, pas quand les deux options deviennent interchangeables. Il faut provisionner ce serveur, le patcher, le monitorer, et intervenir quand il tombe à 3h du matin, et aucun de ces coûts de main-d'œuvre n'est inclus dans les 184 €. Le GEX44 est aussi un plafond de capacité fixe, pas élastique : au-delà d'un certain débit de requêtes, vous ajoutez un deuxième serveur, et la courbe de coût devient une fonction en escalier plutôt que la ligne lisse qu'implique cette arithmétique.
La comparaison ignore aussi le prompt caching, qu'Anthropic tarifie à environ un dixième du tarif d'entrée standard sur les cache hits. Un workload avec un long system prompt stable ou un contexte de document répété peut réduire son coût effectif en entrée suffisamment pour pousser le volume de breakeven réel bien au-dessus de tous les chiffres du tableau, parfois de plus que l'écart de 3x entre les colonnes 1:1 et 10:1 déjà montré. Si une part significative de vos tokens d'entrée est du contenu identique d'une requête à l'autre, calculez le côté API avec le caching appliqué avant de faire confiance à ce tableau plutôt qu'à votre propre estimation. Le taux EUR/USD est aussi un instantané : il était de 1,1699 le jour de la mesure et évolue avec le marché des changes, ce qui déplace chaque chiffre en dollars dérivé du prix serveur de 184 € du même pourcentage que le taux.
Enfin, rien de tout cela ne tient compte de la bande passante sortante, des frais de mise en service que Hetzner facture une fois par serveur, ni du fait que les tarifs publics d'Anthropic ne sont pas nécessairement ce qu'un compte à fort volume paie réellement une fois un tarif entreprise négocié. Les deux côtés de cette comparaison utilisent des tarifs publics ; un devis réel de part ou d'autre peut différer de ce qui est modélisé ici.
Reproduire le calcul
Cette section s'adresse aux lecteurs qui souhaitent entrer leurs propres chiffres ; ce n'est pas un prérequis : le tableau brut ci-dessus couvre déjà trois niveaux de modèle à trois ratios, et la plupart des workloads tombent à proximité de l'une de ces neuf cases. Si ce n'est pas votre cas, passez directement aux Sources.
Si vous souhaitez vos propres chiffres sans lancer de script, le calculateur de coût API LLM applique cette même formule dans le navigateur, sur cinq paliers Claude plus GPT-5 et Gemini : choisissez un modèle, déplacez le curseur de ratio, saisissez votre coût serveur, et le résultat se recalcule à la saisie (accès gratuit ; le chiffre lui-même est disponible après renseignement d'une adresse e-mail).
Si vous préférez ne pas vous fier à un outil hébergé, l'artefact lié en haut de cette page est le même calcul sous forme d'un fichier Node brut : aucune installation, aucune dépendance, aucun appel réseau, chaque prix déclaré en constante en tête de fichier et sourcé depuis les liens ci-dessous. C'est le fichier à vérifier si Anthropic, Hetzner ou le taux EUR/USD bougent après publication ; le tableau ci-dessus et le calculateur dériveront tous les deux jusqu'à ce que quelqu'un mette les trois à jour.
Sources
Le tarif de l'API Claude par modèle, y compris la note indiquant que le tarif introductif 2 $/10 $ de Sonnet 5 est devenu le tarif standard plutôt que de passer à 3 $/15 $ le 2026-09-01, provient de la documentation de tarification de la plateforme Claude d'Anthropic, consultée le 2026-08-24. La remise d'environ 10x sur les tokens d'entrée en cas de cache hit pour le prompt caching, mentionnée dans « Ce que ces chiffres ne disent pas », est documentée sur la page prompt caching de la même plateforme. La spécification du GEX44 et son tarif de 184 €/mois proviennent de la matrice des serveurs GPU dédiés Hetzner. La conversion EUR/USD utilise le taux de référence euro BCE de 1,1699, publié le 2026-08-21.
Cas rapportés
Juste votre email, rien d’autre à remplir. Alex vous répond.