GLM-5.3-Flash to model multimodalny skoncentrowany na efektywności, stworzony przez Z.ai. Obsługuje okno kontekstowe o długości około miliona tokenów, akceptuje tekst, obrazy i wideo, a jego celem są agenci kodujący, złożone rozumowanie i inżynieria oprogramowania na długą metę. W przypadku obciążeń, które zużywają duże ilości tokenów przez wiele iteracji, nawet niewielka różnica w cenie dostępu może szybko się kumulować.
Od 1 września 2026 zarówno oficjalne API Z.ai, jak i trasa Z.ai na OpenRouter oferują GLM-5.3-Flash w cenie 0,075 USD za milion tokenów wejściowych, 0,25 USD za milion tokenów wyjściowych oraz 0,015 USD za milion tokenów wejściowych w pamięci podręcznej. Plan płatności w OpenRouter również pobiera 5,5% opłaty platformowej. W ramach tej samej promocji, AIHubMix GLM-5.3-Flash jest oferowany w cenie 0,056 USD za milion tokenów wejściowych, 0,197 USD za milion tokenów wyjściowych oraz 0,014 USD za milion tokenów wejściowych w pamięci podręcznej.
Wszystkie trzy opcje zapewniają dostęp do tego samego modelu, ale ich ceny, zachowanie tras i funkcje platformy nie są identyczne.
Porównanie cen GLM-5.3-Flash
| Opcja dostępu | Wejście / 1M tokenów | Wyjście / 1M tokenów | Odczyt z pamięci podręcznej / 1M tokenów | Opłata platformowa | Cena przed zniżką (wejście / wyjście / pamięć podręczna) | Pozycjonowanie |
|---|---|---|---|---|---|---|
| Oficjalne API Z.ai | 0,075 USD | 0,250 USD | 0,015 USD | Brak | 0,150 USD / 0,500 USD / 0,030 USD | Bezpośrednie oficjalne API |
| OpenRouter (dostawca Z.ai) | 0,075 USD | 0,250 USD | 0,015 USD | 5,5% | 0,150 USD / 0,500 USD / 0,030 USD | Ujednolicone API z trasowaniem wielu dostawców |
| AIHubMix GLM-5.3-Flash | 0,056 USD | 0,197 USD | 0,014 USD | Brak | 0,113 USD / 0,394 USD / 0,028 USD | Niższe obecne stawki z możliwością przejścia do wielu dostawców |
Wszystkie powyższe ceny to stawki za milion tokenów, zaokrąglone, aby odpowiadały publicznym stronom cenowym. Czasowe promocje 50% na AIHubMix, OpenRouter i Z.ai kończą się 9 września 2026 o 16:00 UTC (10 września o 00:00 UTC+8).
Opłata platformowa OpenRouter w wysokości 5,5%
Strona cenowa OpenRouter podaje 5,5% opłaty platformowej dla kont płatności na zasadzie pay-as-you-go. OpenRouter również stwierdza, że nie podnosi cen dostawców pokazanych w swoim katalogu modeli. Innymi słowy, 0,075 USD / 0,25 USD pozostaje podaną ceną za inferencję modelu, ale opłata platformowa musi być wciąż uwzględniona w całkowitej kwocie zapłaconej za kredyty.
Jeśli opłata w wysokości 5,5% jest proporcjonalnie przypisana do użycia modelu i wszystkie zakupione kredyty są wykorzystane, efektywny koszt OpenRouter dla trasy Z.ai wynosi około:
- Wejście: 0,0791 USD za milion tokenów
- Wyjście: 0,2638 USD za milion tokenów
- Odczyt z pamięci podręcznej: 0,0158 USD za milion tokenów
Przykłady kosztów przy różnych wskaźnikach pamięci podręcznej
Zgodnie z dokumentacją Z.ai na temat pamięci podręcznej kontekstu, powtarzające się systemowe zapytania, historia rozmów i inny wspólny kontekst mogą być wykrywane i automatycznie przechowywane w pamięci podręcznej bez ręcznej konfiguracji. Tokeny serwowane z pamięci podręcznej są rozliczane według stawki odczytu z pamięci podręcznej, a nie według standardowej stawki wejściowej.
Nie ma jednego wskaźnika pamięci podręcznej, który reprezentowałby każde obciążenie:
- Jednorazowe zapytanie lub zadanie z całkowicie różnym wejściem za każdym razem może mieć wskaźnik pamięci podręcznej bliski 0%.
- Zadania wsadowe, które ponownie wykorzystują stałe zapytanie systemowe, mogą osiągnąć znacząco wyższy wskaźnik pamięci podręcznej.
- Agenci kodujący wieloetapowo wielokrotnie przekazują instrukcje systemowe, kontekst kodu i historię rozmów. Ich późniejsze zapytania mogą mieć wysoki wskaźnik pamięci podręcznej, chociaż zmiany treści, różnice w formacie i wygaśnięcie pamięci podręcznej mogą go zmniejszyć.
Aby wyizolować różnicę w cenie, poniższe przykłady zakładają jeden milion całkowitych tokenów wejściowych i jeden milion tokenów wyjściowych, z tym samym wskaźnikiem pamięci podręcznej na obu platformach. Całkowity koszt OpenRouter uwzględnia jego 5,5% opłatę platformową.
| Wskaźnik pamięci podręcznej wejścia | AIHubMix | Koszt modelu OpenRouter | OpenRouter z opłatą platformową | Oszczędności AIHubMix w porównaniu do całkowitego kosztu OpenRouter |
|---|---|---|---|---|
| 0% (zimne zapytania) | 0,253 USD | 0,325 USD | 0,343 USD | 26,2% |
| 50% | 0,232 USD | 0,295 USD | 0,311 USD | 25,5% |
| 80% (wysoce powtarzalny kontekst) | 0,219 USD | 0,277 USD | 0,292 USD | 24,9% |
Obliczenie to: standardowe tokeny wejściowe x stawka wejściowa + tokeny z pamięci podręcznej x stawka odczytu z pamięci podręcznej + tokeny wyjściowe x stawka wyjściowa. Przy wskaźniku pamięci podręcznej wynoszącym 80%, na przykład, jeden milion całkowitych tokenów wejściowych dzieli się na 200 000 standardowych tokenów wejściowych i 800 000 tokenów wejściowych w pamięci podręcznej.
Wyższe wskaźniki pamięci podręcznej obniżają całkowity koszt na obu platformach. Ponieważ różnica między ich stawkami odczytu z pamięci podręcznej jest mniejsza niż różnica między ich standardowymi stawkami wejściowymi i wyjściowymi, względne oszczędności AIHubMix nieco się zmniejszają w miarę wzrostu wskaźnika pamięci podręcznej. W tych przykładach oszczędności pozostają na poziomie około 24,9% do 26,2%.
Dlaczego najniższa cena tokenów nie jest jedynym czynnikiem
Na podstawie obecnych stawek tokenów, AIHubMix jest najtańszą z trzech opcji dostępu. Decyzja produkcyjna powinna jednak uwzględniać zachowanie tras i możliwości platformy.
Oficjalne API Z.ai jest naturalnym wyborem dla zespołów, które preferują bezpośrednią integrację z dostawcą i chcą zminimalizować pośrednie warstwy.
OpenRouter zapewnia ujednolicone API i szeroki ekosystem wielu dostawców. Gdy zapytania są przypisane do Z.ai, jego stawka katalogowa odpowiada oficjalnym cenom Z.ai, ale użytkownicy płatności na zasadzie pay-as-you-go również płacą 5,5% opłaty platformowej. Jeśli OpenRouter ma możliwość automatycznego wyboru innych dostawców, cena modelu, opóźnienie i stawki odczytu z pamięci podręcznej mogą się różnić w zależności od wybranej trasy.
AIHubMix obecnie łączy niższe ceny wejściowe i wyjściowe z monitorowaniem dostawców i możliwością przejścia do innego dostawcy, gdy dostawca upstream zawodzi lub odpowiada zbyt wolno. Ta kombinacja jest szczególnie przydatna dla wrażliwych na koszty agentów kodujących, przetwarzania wsadowego i innych obciążeń o wysokiej liczbie tokenów.
Praktyczne wnioski
Od 1 września 2026, oficjalne API Z.ai i trasa Z.ai w OpenRouter mają te same stawki katalogowe: 0,075 USD za milion tokenów wejściowych i 0,25 USD za milion tokenów wyjściowych. OpenRouter pay-as-you-go również wiąże się z 5,5% opłatą platformową. AIHubMix obecnie pobiera 0,056 USD za milion tokenów wejściowych i 0,197 USD za milion tokenów wyjściowych. W scenariuszach od 0% do 80% pamięci podręcznej wejściowej powyżej, AIHubMix kosztuje około 24,9% do 26,2% mniej niż OpenRouter po uwzględnieniu opłaty platformowej.
Jeśli głównym celem jest obniżenie kosztów tokenów GLM-5.3-Flash dla kodowania, oceny i przepływów pracy agentów, AIHubMix GLM-5.3-Flash jest obecnie tańszą opcją. OpenRouter pozostaje wartościowy, gdy ważniejsze są ujednolicona końcówka wielu dostawców i elastyczne trasowanie, podczas gdy oficjalne API Z.ai jest bezpośrednią trasą do dostawcy.
Ceny, promocje i dostępność dostawców mogą się zmieniać. Sprawdź powiązane strony cenowe przed podjęciem decyzji o długoterminowym obciążeniu.




