Definition
Multimodal AI refers to AI systems that process and integrate multiple data modalities (text, images, audio, video) simultaneously.
Qwen3.8-Omni-Flash Agent Layer (September 2026)
- alibaba released qwen-3-8-omni-flash — 1M-token context, text/image/audio/video input, text output with tool orchestration
- Paired with qwen-mm-plugins and Qwen-Live Harness for agent workflows
- Pricing from $0.15/M input tokens; 6-region API availability
- Orchestration pattern: model analyzes multimodal input → calls external tools for media production
Video Intelligence (2026)
twelvelabs $100M Series B (July 2026) signals capital shift toward agentic video stacks — Marengo embeddings + Pegasus extraction + persistent video memory (video-intelligence).
Related
-
2026-09-18: damo-radar vision-language model for 3D abdominal CT + clinical reports (2026-09-18-alibaba-damo-radar-medical-ai)