Alibaba veut s’imposer comme un acteur central dans la course à l’intelligence artificielle multimodale. L’entreprise a dévoilé Qwen-3 Omni, un modèle de fondation open source multilingue capable de traiter texte, image, audio et vidéo. Cette annonce marque une étape clé dans la rivalité mondiale autour des modèles unifiés, avec l’ambition de rivaliser avec les solutions propriétaires déjà dominantes.
Une avancée technique majeure
« Qwen-3 Omni serait le premier modèle unifié à maintenir des performances de pointe sur toutes ces modalités, sans perte de précision par rapport à ses équivalents monomodaux spécialisés », affirme l’équipe de développement. Contrairement aux architectures qui s’appuient sur un socle textuel enrichi ensuite d’autres fonctions, ce modèle a été entraîné dès le départ sur des données textuelles, visuelles et audio-visuelles.
Cette approche évite la dégradation de performance observée dans les systèmes hybrides. Elle repose sur une architecture Thinker–Talker, héritée de Qwen-2.5 Omni mais optimisée pour réduire la latence et améliorer la qualité des échanges. Le module Thinker gère la génération textuelle, tandis que Talker se charge de restituer la voix. Cette séparation nette permet de personnaliser aussi bien le style d’écriture que le ton et le rythme de la parole générée.
Les performances et perspectives
Sur 36 benchmarks audio et audio-visuels, Qwen-3 Omni a atteint l’état de l’art open source dans 32 cas et s’est classé premier sur 22 d’entre eux. Ces résultats surpassent même, dans certains scénarios, des modèles de référence propriétaires comme Gemini-2.5 Pro, Seed-ASR ou GPT-4o-Transcribe. L’équipe met en avant l’intégration d’innovations techniques, dont l’encodeur AuT (Audio Transformer) entraîné sur 20 millions d’heures d’audio supervisé et la synthèse vocale multi-codebook, capable de restituer des voix diversifiées avec une faible latence.

La rapidité constitue un autre point fort. Grâce à une architecture allégée et à une réduction du taux de codage audio, la réactivité atteint environ 211 millisecondes pour l’audio et 507 millisecondes pour les scénarios audio-vidéo. Une performance qui rapproche ce modèle d’une interaction en temps réel, essentielle pour les usages industriels et grand public.
Ces avancées ouvrent de nouvelles perspectives. Les prochaines versions devraient intégrer la reconnaissance vocale multi-intervenants, l’OCR vidéo et l’apprentissage audio–vidéo plus proactif. L’ajout de fonctionnalités adaptées aux workflows agents et aux appels de fonctions renforcera aussi son attractivité pour des cas d’usage en production. Cette orientation montre la volonté d’Alibaba d’ancrer Qwen-3 Omni dans l’écosystème open source tout en se positionnant face aux géants américains.



