GLM-5.3-Flash é o modelo multimodal nativo da Z.ai focado em eficiência. Ele suporta uma janela de contexto de aproximadamente um milhão de tokens, aceita entrada de texto, imagem e vídeo, e é direcionado a agentes de codificação, raciocínio complexo e engenharia de software de longo prazo. Para cargas de trabalho que consomem grandes volumes de tokens ao longo de muitas iterações, até mesmo uma pequena diferença nos preços de acesso pode rapidamente se acumular.
A partir de 1 de setembro de 2026, a API oficial da Z.ai e a rota da Z.ai no OpenRouter listam o GLM-5.3-Flash a $0,075 por milhão de tokens de entrada, $0,25 por milhão de tokens de saída e $0,015 por milhão de tokens de entrada em cache. O plano pay-as-you-go do OpenRouter também cobra uma taxa de plataforma de 5,5%. Durante a mesma promoção, AIHubMix GLM-5.3-Flash é listado a $0,056 por milhão de tokens de entrada, $0,197 por milhão de tokens de saída e $0,014 por milhão de tokens de entrada em cache.
Todas as três opções fornecem acesso ao mesmo modelo, mas seus preços, comportamento de roteamento e recursos da plataforma não são idênticos.
Comparação de Preços do GLM-5.3-Flash
| Opção de acesso | Entrada / 1M tokens | Saída / 1M tokens | Leitura de cache / 1M tokens | Taxa de plataforma | Preço pré-desconto (entrada / saída / cache) | Posicionamento |
|---|---|---|---|---|---|---|
| API oficial da Z.ai | $0,075 | $0,250 | $0,015 | Nenhuma listada | $0,150 / $0,500 / $0,030 | API oficial direta |
| OpenRouter (fornecedor da Z.ai) | $0,075 | $0,250 | $0,015 | 5,5% | $0,150 / $0,500 / $0,030 | API unificada com roteamento multi-fornecedor |
| AIHubMix GLM-5.3-Flash | $0,056 | $0,197 | $0,014 | Nenhuma listada | $0,113 / $0,394 / $0,028 | Taxas atuais mais baixas com fallback multi-fornecedor |
Todos os preços acima são as taxas exibidas por milhão de tokens, arredondadas para corresponder às páginas de preços públicas. As promoções limitadas de 50% no AIHubMix, OpenRouter e Z.ai terminam em 9 de setembro de 2026 às 16:00 UTC (10 de setembro às 00:00 UTC+8).
Taxa de Plataforma de 5,5% do OpenRouter
A página de preços do OpenRouter lista uma taxa de plataforma de 5,5% para contas pay-as-you-go. O OpenRouter também afirma que não aumenta os preços dos fornecedores mostrados em seu catálogo de modelos. Em outras palavras, $0,075 / $0,25 permanece o preço listado para inferência do modelo, mas a taxa de plataforma ainda precisa ser incluída no valor total pago pelos créditos.
Se a taxa de 5,5% for alocada proporcionalmente ao uso do modelo e todos os créditos comprados forem utilizados, o custo efetivo do OpenRouter para a rota da Z.ai é aproximadamente:
- Entrada: $0,0791 por milhão de tokens
- Saída: $0,2638 por milhão de tokens
- Leitura de cache: $0,0158 por milhão de tokens
Exemplos de Custo em Diferentes Proporções de Cache
De acordo com a documentação de cache de contexto da Z.ai, prompts de sistema repetidos, histórico de conversas e outros contextos compartilhados podem ser detectados e armazenados em cache automaticamente sem configuração manual. Tokens servidos do cache são cobrados à taxa de leitura de cache em vez da taxa padrão de entrada.
Não há uma única proporção de cache que represente todas as cargas de trabalho:
- Um pedido único, ou uma tarefa com entrada totalmente diferente a cada vez, pode ter uma proporção de cache próxima de 0%.
- Trabalhos em lote que reutilizam um prompt de sistema fixo podem alcançar uma proporção de cache significativamente maior.
- Agentes de codificação de múltiplas interações carregam repetidamente instruções do sistema, contexto de código e histórico de conversas. Seus pedidos posteriores podem ter uma alta proporção de cache, embora mudanças de conteúdo, diferenças de formatação e expiração de cache possam reduzi-la.
Para isolar a diferença de preços, os exemplos abaixo assumem um milhão de tokens de entrada total e um milhão de tokens de saída, com a mesma proporção de cache em ambas as plataformas. O total do OpenRouter inclui sua taxa de plataforma de 5,5%.
| Proporção de cache de entrada | AIHubMix | Custo do modelo OpenRouter | OpenRouter incluindo taxa de plataforma | Economia do AIHubMix em relação ao total do OpenRouter |
|---|---|---|---|---|
| 0% (pedidos frios) | $0,253 | $0,325 | $0,343 | 26,2% |
| 50% | $0,232 | $0,295 | $0,311 | 25,5% |
| 80% (contexto altamente repetitivo) | $0,219 | $0,277 | $0,292 | 24,9% |
A cálculo é: tokens de entrada padrão x taxa de entrada + tokens em cache x taxa de leitura de cache + tokens de saída x taxa de saída. Com uma proporção de cache de 80%, por exemplo, um milhão de tokens de entrada total é dividido em 200.000 tokens de entrada padrão e 800.000 tokens de entrada em cache.
Proporções de cache mais altas reduzem o custo total em ambas as plataformas. Como a diferença entre suas taxas de leitura de cache é menor do que a diferença entre suas taxas de entrada e saída padrão, as economias relativas do AIHubMix diminuem ligeiramente à medida que a proporção de cache aumenta. Ao longo desses exemplos, a economia permanece aproximadamente 24,9% a 26,2%.
Por que o Preço Mais Baixo por Token Não é o Único Fator
Com base apenas nas taxas atuais de tokens, o AIHubMix é a opção de acesso menos cara das três. Uma decisão de produção ainda deve levar em conta o comportamento de roteamento e as capacidades da plataforma.
A API oficial da Z.ai é uma escolha natural para equipes que preferem uma integração direta com o fornecedor e desejam minimizar camadas intermediárias.
OpenRouter fornece uma API unificada e um amplo ecossistema multi-fornecedor. Quando os pedidos são direcionados para a Z.ai, sua taxa de catálogo corresponde ao preço oficial da Z.ai, mas os usuários pay-as-you-go também pagam a taxa de plataforma de 5,5%. Se o OpenRouter for autorizado a selecionar automaticamente outros fornecedores, o preço do modelo, latência e taxas de leitura de cache podem variar com a rota selecionada.
AIHubMix atualmente combina preços de entrada e saída mais baixos com monitoramento de fornecedores e fallback quando um fornecedor upstream falha ou responde muito lentamente. Essa combinação é particularmente útil para agentes de codificação sensíveis a custos, processamento em lote e outras cargas de trabalho de alto volume de tokens.
Conclusão Prática
A partir de 1 de setembro de 2026, a API oficial da Z.ai e a rota da Z.ai do OpenRouter têm as mesmas taxas de catálogo: $0,075 por milhão de tokens de entrada e $0,25 por milhão de tokens de saída. O OpenRouter pay-as-you-go também possui uma taxa de plataforma de 5,5%. O AIHubMix atualmente cobra $0,056 por milhão de tokens de entrada e $0,197 por milhão de tokens de saída. Em todos os cenários de cache de entrada de 0% a 80% acima, o AIHubMix custa aproximadamente 24,9% a 26,2% menos do que o OpenRouter após a inclusão da taxa de plataforma.
Se o principal objetivo é reduzir os custos de tokens do GLM-5.3-Flash para codificação, avaliação e fluxos de trabalho de agentes, AIHubMix GLM-5.3-Flash é atualmente a opção de menor custo. O OpenRouter continua sendo valioso quando um ponto de extremidade multi-fornecedor unificado e roteamento flexível são mais importantes, enquanto a API oficial da Z.ai é a rota direta do fornecedor.
Os preços, promoções e a disponibilidade de fornecedores podem mudar. Verifique as páginas de preços vinculadas antes de comprometer uma carga de trabalho de longa duração.




