Comparaison des prix de GLM-5.3-Flash : OpenRouter, Z.ai et AIHubMix

AIHubMix4 min de lecture
Comparaison des prix de GLM-5.3-Flash : OpenRouter, Z.ai et AIHubMix

GLM-5.3-Flash est le modèle multimodal natif axé sur l'efficacité de Z.ai. Il prend en charge une fenêtre de contexte d'environ un million de tokens, accepte les entrées textuelles, d'image et vidéo, et cible les agents de codage, le raisonnement complexe et l'ingénierie logicielle à long terme. Pour les charges de travail qui consomment de grands volumes de tokens sur de nombreuses itérations, même une petite différence dans les prix d'accès peut rapidement s'accumuler.

À partir du 1er septembre 2026, l'API officielle de Z.ai et la route Z.ai sur OpenRouter affichent toutes deux GLM-5.3-Flash à 0,075 $ par million de tokens d'entrée, 0,25 $ par million de tokens de sortie, et 0,015 $ par million de tokens d'entrée mis en cache. Le plan de paiement à l'utilisation d'OpenRouter facture également des frais de plateforme de 5,5 %. Pendant la même promotion, AIHubMix GLM-5.3-Flash est affiché à 0,056 $ par million de tokens d'entrée, 0,197 $ par million de tokens de sortie, et 0,014 $ par million de tokens d'entrée mis en cache.

Les trois options donnent accès au même modèle, mais leurs prix, comportements de routage et fonctionnalités de plateforme ne sont pas identiques.

Comparaison des prix de GLM-5.3-Flash

Option d'accès Entrée / 1M tokens Sortie / 1M tokens Lecture de cache / 1M tokens Frais de plateforme Prix avant remise (entrée / sortie / cache) Positionnement
API officielle de Z.ai 0,075 $ 0,250 $ 0,015 $ Aucun indiqué 0,150 $ / 0,500 $ / 0,030 $ API officielle directe
OpenRouter (fournisseur Z.ai) 0,075 $ 0,250 $ 0,015 $ 5,5 % 0,150 $ / 0,500 $ / 0,030 $ API unifiée avec routage multi-fournisseur
AIHubMix GLM-5.3-Flash 0,056 $ 0,197 $ 0,014 $ Aucun indiqué 0,113 $ / 0,394 $ / 0,028 $ Taux actuels plus bas avec secours multi-fournisseur

Tous les prix ci-dessus sont les tarifs affichés par million de tokens, arrondis pour correspondre aux pages de prix publiques. Les promotions limitées à 50 % sur AIHubMix, OpenRouter et Z.ai se terminent toutes le 9 septembre 2026 à 16h00 UTC (10 septembre à 00h00 UTC+8).

Frais de plateforme de 5,5 % d'OpenRouter

La page de prix d'OpenRouter indique des frais de plateforme de 5,5 % pour les comptes à paiement à l'utilisation. OpenRouter précise également qu'il ne majorent pas les prix des fournisseurs affichés dans son catalogue de modèles. En d'autres termes, 0,075 $ / 0,25 $ reste le prix d'inférence du modèle indiqué, mais les frais de plateforme doivent toujours être inclus dans le montant total payé pour les crédits.

Si les frais de 5,5 % sont répartis proportionnellement à l'utilisation du modèle et que tous les crédits achetés sont utilisés, le coût effectif d'OpenRouter pour la route Z.ai est d'environ :

  • Entrée : 0,0791 $ par million de tokens
  • Sortie : 0,2638 $ par million de tokens
  • Lecture de cache : 0,0158 $ par million de tokens

Exemples de coûts à différents ratios de cache

Selon la documentation sur la mise en cache de contexte de Z.ai, les invites système répétées, l'historique des conversations et d'autres contextes partagés peuvent être détectés et mis en cache automatiquement sans configuration manuelle. Les tokens servis depuis le cache sont facturés au tarif de lecture de cache au lieu du tarif d'entrée standard.

Il n'existe pas de ratio de cache unique qui représente chaque charge de travail :

  • Une demande unique, ou une tâche avec des entrées entièrement différentes à chaque fois, peut avoir un ratio de cache proche de 0 %.
  • Les travaux par lots qui réutilisent une invite système fixe peuvent atteindre un ratio de cache significativement plus élevé.
  • Les agents de codage multi-tours portent à plusieurs reprises des instructions système, un contexte de code et un historique de conversation. Leurs demandes ultérieures peuvent avoir un ratio de cache élevé, bien que les changements de contenu, les différences de formatage et l'expiration du cache puissent le réduire.

Pour isoler la différence de prix, les exemples ci-dessous supposent un million de tokens d'entrée au total et un million de tokens de sortie, avec le même ratio de cache sur les deux plateformes. Le total d'OpenRouter inclut ses frais de plateforme de 5,5 %.

Ratio de cache d'entrée AIHubMix Coût du modèle OpenRouter OpenRouter incluant les frais de plateforme Économies d'AIHubMix par rapport au total d'OpenRouter
0 % (demandes froides) 0,253 $ 0,325 $ 0,343 $ 26,2 %
50 % 0,232 $ 0,295 $ 0,311 $ 25,5 %
80 % (contexte hautement répétitif) 0,219 $ 0,277 $ 0,292 $ 24,9 %

Le calcul est : tokens d'entrée standard x tarif d'entrée + tokens mis en cache x tarif de lecture de cache + tokens de sortie x tarif de sortie. À un ratio de cache de 80 %, par exemple, un million de tokens d'entrée au total est divisé en 200 000 tokens d'entrée standard et 800 000 tokens d'entrée mis en cache.

Des ratios de cache plus élevés réduisent le coût total sur les deux plateformes. Comme la différence entre leurs tarifs de lecture de cache est plus petite que la différence entre leurs tarifs d'entrée et de sortie standard, les économies relatives d'AIHubMix se réduisent légèrement à mesure que le ratio de cache augmente. Dans ces exemples, l'économie reste d'environ 24,9 % à 26,2 %.

Pourquoi le prix le plus bas par token n'est pas le seul facteur

Sur la base des tarifs de tokens actuels, AIHubMix est l'option d'accès la moins chère des trois. Une décision de production devrait néanmoins tenir compte du comportement de routage et des capacités de la plateforme.

L'API officielle de Z.ai est un choix naturel pour les équipes qui préfèrent une intégration directe avec le fournisseur et souhaitent minimiser les couches intermédiaires.

OpenRouter fournit une API unifiée et un large écosystème multi-fournisseur. Lorsque les demandes sont dirigées vers Z.ai, son tarif catalogue correspond aux prix officiels de Z.ai, mais les utilisateurs à paiement à l'utilisation paient également les frais de plateforme de 5,5 %. Si OpenRouter est autorisé à sélectionner automatiquement d'autres fournisseurs, le prix du modèle, la latence et les tarifs de lecture de cache peuvent varier en fonction de la route sélectionnée.

AIHubMix combine actuellement des prix d'entrée et de sortie plus bas avec une surveillance des fournisseurs et un secours lorsque un fournisseur en amont échoue ou répond trop lentement. Cette combinaison est particulièrement utile pour les agents de codage sensibles aux coûts, le traitement par lots et d'autres charges de travail à fort volume de tokens.

Conclusion pratique

À partir du 1er septembre 2026, l'API officielle de Z.ai et la route Z.ai d'OpenRouter ont les mêmes tarifs catalogue : 0,075 $ par million de tokens d'entrée et 0,25 $ par million de tokens de sortie. OpenRouter à paiement à l'utilisation comporte également des frais de plateforme de 5,5 %. AIHubMix facture actuellement 0,056 $ par million de tokens d'entrée et 0,197 $ par million de tokens de sortie. Dans les scénarios de cache d'entrée de 0 % à 80 % ci-dessus, AIHubMix coûte environ 24,9 % à 26,2 % de moins qu'OpenRouter après l'inclusion des frais de plateforme.

Si l'objectif principal est de réduire les coûts des tokens GLM-5.3-Flash pour le codage, l'évaluation et les flux de travail des agents, AIHubMix GLM-5.3-Flash est actuellement l'option la moins coûteuse. OpenRouter reste précieux lorsque l'endpoint multi-fournisseur unifié et le routage flexible sont plus importants, tandis que l'API officielle de Z.ai est la voie directe vers le fournisseur.

Les prix, promotions et disponibilités des fournisseurs peuvent changer. Vérifiez les pages de prix liées avant de vous engager dans une charge de travail à long terme.