VIDEO 3.0 Omni: All-in-One Multimodal Input, Voice-Driven Characters, Direct Audio-Visual Output, and Storyboarding Building on the Kling VIDEO O1 and Kling VIDEO 2.6, the Kling 3.0 Model Series leverage a deeply integrated unified model training framework, achieving more native multimodal input and output. It combines Native Audio with Element Consistency Control, and breaks through duration limits.
Pricing
- Input Tokens: $2.000 /M tokens
- Output Tokens: $0.000 /M tokens
- Cache Read: $0.000 /M tokens
Image Generation
Quality
standard
std
$0.0845
pro
$0.1127
4k
$0.4225
Input Modalities
- Text
- Vision
Output Modalities
- Video
