The Qwen3-VL series’ second-largest MoE model Instruct version offers fast response speed and supports ultra-long contexts such as long videos and long documents; it features comprehensive upgrades in image/video understanding, spatial perception, and universal recognition abilities; it also provides visual 2DD/3D localization capabilities, making it capable of handling complex real-world tasks.
Pricing
- Input Tokens: $0.103 /M tokens
- Output Tokens: $0.411 /M tokens
Input Modalities
- Text
- Vision
- Video
Output Modalities
- Text
Capabilities
- Tools
- Tool calling
- Structured outputs
Try this model
Python
