Aller au contenu principal
AGE Services
Logo Qwen

Qwen

Pour bien commencer — la présentation complète

Site officiel Alibaba Cloud
Qwen — aperçu de l'interface (Alibaba Cloud)

Qwen, l’écosystème ouvert d’Alibaba

Qwen est la famille de modèles d’intelligence artificielle développée par Alibaba (Chine). Sa particularité structurelle : une large part de la gamme est diffusée à poids ouverts sous licence Apache 2.0 — paramètres publiquement téléchargeables et auto-hébergeables — couvrant non seulement le texte, mais aussi le code, la vision, l’omnimodal, l’image et l’audio.

Cette ouverture ne couvre cependant pas tout : depuis 2026, les modèles phares les plus récents (la lignée Max) sont devenus propriétaires et accessibles par API uniquement. L’écosystème combine donc des modèles ouverts que l’on installe où l’on veut, et des modèles fermés consommés comme un service.

Trois traits structurants
Ouvert
Poids publics, Apache 2.0
L'essentiel de la gamme se télécharge et s'auto-héberge librement, du modèle léger au MoE massif.
Complet
Toutes les modalités
Texte, code, vision, omni (audio/vidéo), génération d'images, embeddings, reconnaissance et synthèse vocales.
Long contexte
256 k → 1 M tokens
Contexte natif de 256 k tokens, extensible jusqu'à 1 million selon les modèles.

Les surfaces produit

L’écosystème Qwen s’aborde par trois portes principales — un assistant grand public, une plateforme d’API, et la distribution des poids — complétées par des outils pour développeurs.

Trois portes d'entrée
Qwen Chat
L'assistant
Le chat grand public (gratuit) : conversation, images, vidéo, recherche approfondie, Artifacts.
Model Studio
La plateforme API
L'API de production d'Alibaba Cloud (DashScope), compatible OpenAI, avec fine-tuning, RAG et agents.
Poids ouverts
Le self-hosting
Les modèles téléchargeables (Hugging Face, ModelScope) à servir sur sa propre infrastructure.

Démo officielle de la chaîne Qwen : l’assistant Qwen Chat en interaction multimodale — dialogue par la voix et la vidéo en temps réel (gamme « Omni »).

État de l'offre au 12 juin 2026

Les surfaces produit

Surface
Ce qu'elle fait
Accès
Qwen Chat
Assistant : chat, image/vidéo, Deep Research, Artifacts.
Gratuit · web, iOS, Android, desktop
Model Studio / DashScope
Plateforme API : inférence, fine-tuning, RAG, agents, batch.
API · compatible OpenAI
Poids ouverts
Téléchargement des modèles pour auto-hébergement.
Hugging Face · ModelScope · GitHub
Qwen Code
Agent de code en terminal (CLI), plugins VS Code / JetBrains / Zed.
Open source (Apache 2.0)
Qwen-Agent
Framework agent : function calling, MCP, RAG, Code Interpreter.
Open source — backend de Qwen Chat

L’API Model Studio offre une compatibilité avec l’API OpenAI (bascule sans réécrire le code), le fine-tuning, une base de connaissances (RAG), des agents et un mode par lots. Côté développeurs, Qwen Code est un agent de code en ligne de commande (open source), et Qwen-Agent le framework qui sert de moteur à Qwen Chat.

La lignée des modèles

Le catalogue se lit selon deux axes : la modalité (texte, code, vision…) et le régime de licence (ouvert ou propriétaire). Le tableau ci-dessous donne l’état de la gamme.

État de la gamme au 12 juin 2026

La lignée des modèles Qwen

Modèle
Type
Licence
Rôle
Qwen3.7-Max (phare)
Propriétaire · API
Commerciale
Modèle « agent-first », contexte 1 M.
Qwen3.6 / Qwen3.5
Ouvert (dense + MoE)
Apache 2.0
Généralistes texte, du 0,8 B au MoE 397B-A17B.
Qwen3-Coder-480B-A35B
Ouvert (MoE)
Apache 2.0
Code agentique ; API qwen3-coder (contexte 1 M).
Qwen3-VL (2B → 235B-A22B)
Ouvert
Apache 2.0
Vision-langage, contexte 256 k → 1 M.
Qwen3-Omni-30B-A3B
Ouvert (MoE)
Apache 2.0
Omni : texte + audio + image + vidéo, voix temps réel.
Qwen-Image / Qwen-Image-Edit
Ouvert
Apache 2.0
Génération et édition d'images (rendu de texte).
Qwen3-Embedding / Reranker
Ouvert
Apache 2.0
Recherche sémantique et RAG (100+ langues).
Qwen3-ASR / Qwen3-TTS
Ouvert
Ouverte
Reconnaissance et synthèse vocales.

Deux points d’attention sur l’évolution récente. D’abord, le basculement du flagship vers le fermé : Qwen3.7-Max (mai 2026) et ses variantes Plus sont propriétaires, après une lignée historiquement ouverte. Ensuite, le point de comparaison a changé : l’éditeur positionne désormais ses modèles face à la génération frontière 2026 (Claude Opus 4.6, GLM-5.1), et non plus face à GPT-4o ou Claude 3.5 — toute référence à ces derniers serait périmée.

Poids ouverts et déploiement souverain

C’est l’angle le plus distinctif de Qwen : la possibilité de télécharger les modèles et de les exécuter soi-même, sans dépendre d’un service distant. Le chemin est balisé et repose sur des outils standard.

Du téléchargement au déploiement maîtrisé
1
Télécharger
Poids Apache 2.0 publics (Hugging Face, ModelScope).
2
Servir
Via vLLM, SGLang, Ollama, llama.cpp…
3
Héberger
On-premises ou hébergeur européen, sans Alibaba.
4
Coût maîtrisé
Limité à l'infrastructure GPU, pas au token.

Cette voie a une limite à connaître : elle ne donne accès qu’aux variantes ouvertes. Le modèle phare Qwen3.7-Max étant propriétaire, un déploiement entièrement souverain ne peut pas mobiliser le « meilleur » Qwen du moment, mais des modèles ouverts très capables (jusqu’au MoE 397B-A17B, ou Qwen3-Coder-480B-A35B pour le code).

La grille tarifaire de l’API Model Studio

L’API se facture à l’usage, au million de tokens, avec une particularité : la tarification par paliers de longueur de contexte (plus la requête est longue, plus le tarif au million monte). Grille « internationale », en dollars américains.

Tarifs API · USD par million de tokens

La grille tarifaire de l'API

Modèle
Palier de contexte
Entrée
Sortie
qwen3-max (phare ouvert)
0 – 32 k
1,20 $
6 $
qwen3-max
32 k – 128 k
2,40 $
12 $
qwen3-max
128 k – 252 k
3 $
15 $
qwen-plus
0 – 256 k
0,40 $
1,20 $
qwen-plus
256 k – 1 M
1,20 $
3,60 $
qwen-flash
0 – 1 M
0,10 $
0,40 $
qwen-turbo
0,05 $
0,20 $
qwen3-coder
0 – 32 k → 256 k – 1 M
1 → 6 $
5 → 60 $

Trois leviers réduisent la facture : le traitement par lots (−50 % sur entrée et sortie), le cache de contexte (remise sur les tokens d’entrée mis en cache), et un quota gratuit pour les nouveaux comptes (1 M tokens en entrée + 1 M en sortie, par modèle, pendant 90 jours). Réserves : la grille ci-dessus est la grille « internationale » en USD — la grille Chine continentale (RMB) diffère ; et le tarif du flagship Qwen3.7-Max n’est pas encore publié sur Model Studio à date.

Origine, régions et résidence des données

Parce que l’éditeur est chinois, la question de l’origine et de la localisation des données mérite d’être posée — et traitée factuellement, sans verdict.

Trois leviers, un critère à arbitrer

Régions internationales. L’API Model Studio propose des endpoints hors Chine continentale : Singapour (international), US (Virginie), Hong Kong, et une région Francfort (UE) est mentionnée. Les données y sont stockées hors de Chine continentale et les clés d’API ne sont pas interchangeables entre régions. Certaines fonctions restent toutefois limitées à la Chine (ex. l’API Deep Research, région Pékin).

Auto-hébergement. Les modèles à poids ouverts s’exécutent sur une infrastructure entièrement maîtrisée — on-premises ou chez un hébergeur européen — où aucune donnée ne sort du périmètre.

Le critère d’origine. Pour les secteurs soumis à une règle de filière sur l’origine des composants techniques (défense, santé sensible, données strictement encadrées), l’origine de l’éditeur reste un critère à évaluer, y compris en self-hosting. Les garanties contractuelles UE/RGPD et certifications (HDS, ISO 27001) ne sont pas formalisées sur les pages produit et sont à demander à l’éditeur. La région UE de Model Studio est, à date, à confirmer.

Cas d’usage métier

Les briques décrites se combinent en plusieurs usages typiques.

Trois terrains de prédilection
Volumes
Traitement de masse
Auto-héberger un modèle ouvert pour qualifier de grands volumes de données ou de fichiers, à coût d'infrastructure et sans facturation au token.
Code
Développement assisté
Qwen3-Coder et l'agent CLI Qwen Code, intégrés aux IDE (VS Code, JetBrains, Zed) et à l'intégration continue.
Souverain
Déploiement maîtrisé
Modèles Apache 2.0 sur infrastructure européenne, ou API en région internationale hors Chine continentale.

Quand une autre approche est préférable

Plusieurs situations justifient d’examiner d’autres options, ou d’exiger des compléments avant de retenir cette solution.

Cartographie besoin → vigilance
Auto-héberger le meilleur Qwen
Variantes ouvertes (pas le flagship Max)
Qwen3.7-Max est propriétaire / API seulement.
Règle de filière sur l'origine (défense, santé sensible)
À arbitrer : éditeur chinois
Critère d'origine à évaluer même en auto-hébergement.
API hébergée en UE
Vérifier la région Francfort de Model Studio
Mentionnée mais non confirmée ; sinon Singapour / US.
Tarif du flagship Qwen3.7-Max
À confirmer sur Model Studio
Identifiant API et prix pas encore publiés à date.
Cible Chine continentale / budget en euros
Confirmer la grille applicable
Grilles USD (international) et RMB (Chine) distinctes.

En synthèse, Qwen est un écosystème de modèles largement ouverts (Apache 2.0) couvrant toutes les modalités, dont la singularité tient à l’auto-hébergement souverain : télécharger les poids et les servir sur sa propre infrastructure, à coût d’infrastructure plutôt qu’à l’usage. C’est l’argument décisif pour le traitement de gros volumes et les déploiements maîtrisés. En contrepartie, deux éléments structurent toute décision : les modèles phares récents sont fermés (le meilleur Qwen n’est pas auto-hébergeable), et l’origine chinoise de l’éditeur est un critère à arbitrer pour les secteurs régulés — les garanties de résidence et de conformité étant à demander à l’éditeur plutôt qu’à présumer.

Vos questions

Questions fréquentes

Quel est le modèle Qwen le plus récent ?
Au 12 juin 2026, le modèle phare est Qwen3.7-Max (mai 2026), un modèle « agent-first » à contexte 1 million de tokens — mais propriétaire, accessible uniquement par API. Côté poids ouverts (Apache 2.0), les modèles généralistes les plus récents sont Qwen3.6 (dont une variante MoE 35B-A3B) et Qwen3.5 (jusqu'à un MoE de 397 milliards de paramètres, 17 milliards actifs). La famille couvre aussi le code (Qwen3-Coder), la vision (Qwen3-VL), l'omnimodal (Qwen3-Omni), l'image (Qwen-Image) et l'audio (Qwen3-ASR/TTS).
Tous les modèles Qwen sont-ils open source ?
Non. Une large part de la gamme est à poids ouverts sous licence Apache 2.0 (Qwen3.5 et 3.6, Qwen3-Coder, Qwen3-VL, Qwen3-Omni, Qwen-Image, les embeddings), téléchargeable sur Hugging Face et ModelScope. Mais les modèles phares les plus récents — Qwen3.7-Max et ses variantes « Plus » — sont propriétaires et fermés. Conséquence : le « meilleur » Qwen du moment n'est pas auto-hébergeable ; le self-hosting porte sur les variantes ouvertes (jusqu'au MoE 397B-A17B).
Comment Qwen est-il facturé ?
Trois régimes. L'assistant Qwen Chat est gratuit (sans abonnement grand public). L'API Alibaba Cloud Model Studio se facture à l'usage, au million de tokens, avec une tarification par paliers de longueur de contexte (le tarif monte avec la taille de la requête), un traitement par lots à −50 %, un cache de contexte et un quota gratuit pour les nouveaux comptes (1 M tokens en entrée + 1 M en sortie par modèle, 90 jours). En auto-hébergement, le coût se limite à l'infrastructure GPU, sans facturation au token.
Qwen pose-t-il une question de souveraineté des données ?
L'éditeur est Alibaba, groupe chinois — c'est un critère à évaluer pour les secteurs soumis à une règle de filière sur l'origine des composants techniques. Trois éléments factuels nuancent toutefois le sujet : l'API dispose d'endpoints « internationaux » (Singapour, US, voire Francfort) où les données sont stockées hors de Chine continentale ; les poids ouverts permettent un auto-hébergement entièrement souverain sur une infrastructure européenne ; mais les garanties contractuelles et certifications (RGPD, HDS, ISO) sont à demander à l'éditeur, non affichées sur les pages produit.

Discutons de votre projet

Un appel de 30 minutes pour cadrer votre cas d'usage IA.

Sans formulaire de qualification, sans engagement. On parle de votre contexte, on identifie ce qui peut bouger vite, on vous dit honnêtement où l'IA n'apportera rien.