Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Retour au blog

Prix et intégration de l’API Qwen3.8-Flash 2026 : contexte multimodal 1M

Qwen3.8-FlashAPI QwenQwen Flashagent de codecontexte 1M

Le 27 août 2026, au lendemain de la publication de Qwen3.8-Flash-Next avec poids ouverts, nous avons préparé la documentation d’intégration de la route qwen3.8-flash récemment ouverte sur cette passerelle. Le piège le plus courant est dans le nom : les poids ouverts et l’API de production n’ont pas le même identifiant de modèle.

Qwen/Qwen3.8-Flash-Next est un MoE multimodal open source destiné à prévisualiser l’architecture Qwen4 ; qwen3.8-flash est le modèle API de production proposé par Alibaba Cloud Model Studio et QwenCloud. Il prend par défaut en charge 1M de contexte, les entrées image/texte/vidéo, Function Calling et la sortie structurée. Cette passerelle a ouvert la route qwen3.8-flash ; son multiplicateur et le montant réellement débité sont ceux de la page des prix en temps réel et du relevé de compte au moment de la requête.

Cet article sépare l’architecture du modèle ouvert, les capacités de l’API officielle d’Alibaba Cloud, les prix officiels de l’accès direct et la route de cette passerelle. Les benchmarks publiés par l’équipe Qwen ne sont pas une nouvelle mesure indépendante de ce site, et les prix régionaux d’Alibaba Cloud ne peuvent pas être convertis directement en multiplicateur de cette passerelle.

Données clés de Qwen3.8-Flash

Élément Information vérifiée
Date de sortie officielle 26 août 2026
Identifiant API de cette passerelle / Model Studio qwen3.8-flash
Identifiant des poids ouverts Qwen/Qwen3.8-Flash-Next
Structure des paramètres Modèle principal 125B + 51B d’embedding N-gram, 6B activés
Contexte API de production : 1M par défaut ; version ouverte : 262 144 natifs, extensibles à 1M avec YaRN
Modalités d’entrée / sortie Images, texte et vidéos en entrée ; texte en sortie
Capacités API Function Calling, sortie structurée, Web Search et cache de contexte
Positionnement public Agents de code, automatisation bureautique, vision et workflows à haut débit
Multiplicateur de cette passerelle Non inscrit en dur ; consultez la page de prix en temps réel et le relevé réel

Informations vérifiées pour la dernière fois le 27 août 2026. Avant de mettre en production, consultez à nouveau la liste des modèles, la documentation régionale de Model Studio et les champs d’usage de la réponse réelle.

Quel rapport entre Qwen3.8-Flash et Qwen3.8-Flash-Next ?

L’équipe Qwen a d’abord publié les poids de Qwen3.8-Flash-Next afin que la communauté puisse étudier l’architecture annoncée pour Qwen4. La version de production est ensuite proposée sous le nom Qwen3.8-Flash. Les deux partagent une orientation technique, mais leur mode d’appel est différent.

Nom Usage Identifiant exact Contexte
Qwen3.8-Flash-Next Auto-hébergement, recherche architecturale et évaluation open source Qwen/Qwen3.8-Flash-Next 262 144 natifs, extensibles à 1M avec YaRN
Qwen3.8-Flash API de production hébergée qwen3.8-flash 1M par défaut
Qwen3.8-Max Modèle hébergé haut de gamme qwen3.8-max 1M

Si vous utilisez l’interface compatible de cette passerelle ou d’Alibaba Cloud, ne mettez pas le nom du dépôt Hugging Face dans le paramètre model. À l’inverse, en auto-hébergement, écrire seulement l’identifiant de l’API hébergée ne téléchargera pas automatiquement les poids.

Quelle est la nouvelle architecture de Qwen3.8-Flash-Next ?

Qwen3.8-Flash-Next combine Gated DeltaNet (GDN) et Qwen Sparse Attention (QSA) dans une attention hybride. GDN compresse l’historique dans un état de taille fixe, tandis que QSA utilise un indexeur léger pour sélectionner les blocs importants du contexte long. Cela réduit le calcul d’attention et les accès au KV Cache sur les longues séquences.

Le modèle ajoute aussi Gated Residual (GR), qui étend le flux résiduel à quatre branches avec des portes dynamiques de lecture et d’écriture. N-gram Embedding consulte le contexte local dans une table et augmente la capacité du modèle sans ajouter beaucoup de calcul matriciel par token. L’entraînement utilise une version améliorée de Muon Optimizer et une nouvelle estimation de la Scaling Law.

La taille annoncée est de 125B pour le modèle principal, de 51B pour l’embedding N-gram supplémentaire et de 6B paramètres activés par token. L’équipe Qwen indique un coût d’entraînement égal à environ un neuvième de celui de Qwen3.7-Plus ; il s’agit d’une comparaison de formation du fournisseur, pas d’une mesure du coût d’inférence de cette passerelle.

Quelles sont les limites du contexte 1M et de la multimodalité ?

La page modèle Alibaba Cloud Qwen3.8-Flash indique une longueur de contexte de 1 000 000 tokens : l’entrée maximale est de 991 808 en mode normal et de 983 616 en mode réflexion, pour une sortie maximale de 131 072 et une longueur maximale de chaîne de réflexion de 262 144. Les images, le texte et les vidéos peuvent être envoyés en entrée ; la sortie est textuelle.

1M ne signifie pas qu’il faut envoyer près d’un million de tokens à chaque requête. Les instructions système, les schémas d’outils, l’encodage des images ou vidéos, l’historique des messages et la sortie réservée occupent la fenêtre ; une requête très longue augmente aussi la latence et le coût. En production, commencez par mesurer des paliers de 32K, 128K, 256K et long contexte.

La fiche officielle mentionne également Function Calling, la sortie structurée, Web Search et le cache de contexte. Batch est pris en charge dans la région de Pékin, mais indiqué comme non pris en charge à Singapour : vérifiez chaque différence régionale avant le déploiement.

Comment lire les benchmarks de programmation et d’agent de Qwen ?

L’équipe Qwen compare Qwen3.8-Flash-Next à Qwen3.8-27B, Qwen3.7-Plus et DeepSeek-V4-Flash-0731. Voici quatre résultats publiés :

Évaluation publiée par le fournisseur Qwen3.7-Plus Qwen3.8-Flash-Next Type de tâche
DeepSWE 1.1 16.5 58.7 Programmation agentique
SWE-bench Multilingual 75.8 81.0 Génie logiciel multilingue
CoWorkBench 65.1 73.9 Tâches bureautiques longues
Toolathlon Verified 50.6 73.5 Appels d’outils réels

Ces scores viennent de la publication officielle de Qwen et ne sont pas une nouvelle mesure indépendante de cette passerelle. La version du modèle, le budget de raisonnement, l’environnement d’outils et l’évaluateur influencent fortement le résultat. Ne transformez surtout pas les scores de Flash-Next open source en performance de bout en bout de l’API hébergée dans votre client, votre région et votre quota.

Comment distinguer le prix officiel de Qwen3.8-Flash du prix de cette passerelle ?

Dans sa publication de lancement, Qwen indiquait pour la version de production QwenCloud un prix de référence de 0,16 dollar par million de tokens en entrée et de 0,47 dollar par million en sortie ; cette même publication précisait alors que l’API allait bientôt être ouverte. La page modèle Alibaba Cloud Model Studio liste ensuite l’identifiant d’appel qwen3.8-flash et des prix et capacités en CNY différents selon Pékin, Singapour et les autres régions.

Ces deux séries de chiffres relèvent de l’accès direct officiel et peuvent changer selon la région, le cache, Batch ou les promotions. Cette passerelle ne convertit pas le prix officiel en dollars ni le tarif régional de Model Studio en multiplicateur de gateway. Le multiplicateur, le cache et le montant réellement débité pour qwen3.8-flash sont indiqués par la page des prix en temps réel et le relevé de la requête.

Les nouveaux utilisateurs peuvent commencer avec un petit montant sur la page d’achat de l’API ; les utilisateurs disposant déjà d’une clé peuvent ajouter du solde depuis la page de recharge. Fixez le prompt et la taille de contexte, enregistrez les tokens d’entrée, de sortie et de cache, puis comparez le coût réel.

Comment appeler l’API Qwen3.8-Flash ?

Cette passerelle fournit une interface Chat Completions compatible OpenAI. L’identifiant exact est qwen3.8-flash :

curl https://api.llm-token.cn/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash",
    "messages": [
      {
        "role": "user",
        "content": "Summarize the failing tests, then propose the smallest safe patch."
      }
    ]
  }'

Qwen3.8-Flash prend en charge les modes réflexion et non-réflexion, mais les couches compatibles peuvent mapper différemment enable_thinking, reasoning_effort, les paramètres de streaming des outils et les outils intégrés. Commencez par une petite requête textuelle, puis ajoutez séparément réflexion, images, vidéos, outils et long contexte ; n’envoyez pas toutes les extensions à la fois.

Pour quelles tâches Qwen3.8-Flash est-il adapté ?

  • agents de code à haut débit, revue de code et analyse d’échecs de tests
  • dépôts multilingues et tâches de génie logiciel proches de SWE-bench
  • automatisation bureautique longue pour les e-mails, feuilles de calcul, documents et réunions
  • compréhension d’images, de graphiques et de longues vidéos
  • workflows avec Function Calling, sortie structurée et Web Search
  • longs documents et grands dépôts qui ont besoin de 1M de contexte avec un budget maîtrisé
  • recherche sur l’architecture Qwen4 prévisualisée en auto-hébergement et adaptation de moteurs d’inférence

Pour les décisions d’architecture complexes, les audits de sécurité critiques ou les tâches ponctuelles à forte valeur, comparez encore avec Qwen3.8-Max, GLM-5.3, Claude ou un autre modèle avancé. L’intérêt de Flash est son rapport coût-débit, pas de remplacer toutes les évaluations par un seul modèle.

Qwen3.8-Flash ou Qwen3.8-Max : lequel choisir ?

Si la charge est élevée et qu’elle exige multimodalité, appels d’outils et contexte de 1M, commencez par un petit trafic sur Qwen3.8-Flash. Si elle exige surtout le meilleur niveau de raisonnement, la tolérance aux erreurs et la qualité d’une sortie critique, exécutez le même test avec Qwen3.8-Max.

Ne comparez pas une seule réponse. Mesurez au moins le taux de réussite, la latence du premier token, la durée totale, le taux de réussite des outils, les tokens d’entrée et de sortie, les hits de cache et le nombre de reprises. Un modèle moins cher peut coûter davantage s’il nécessite plus de tentatives.

Checklist d’évaluation en production

  1. Utilisez qwen3.8-flash pour l’API hébergée et Qwen/Qwen3.8-Flash-Next pour l’auto-hébergement.
  2. Fixez le dépôt, le prompt, la version des outils, les délais et la commande d’acceptation avant de comparer.
  3. Vérifiez séparément les modes réflexion et non-réflexion et consignez les différences de format.
  4. Testez séparément le texte, les images, les vidéos, Function Calling et la sortie structurée.
  5. Mesurez la latence et la facture par paliers de 32K, 128K, 256K et long contexte.
  6. Vérifiez que la région choisie prend en charge Batch, le cache et les outils intégrés requis.
  7. Fixez des limites au nombre d’appels d’outils, à la sortie maximale, au budget total et aux actions externes.
  8. Préparez une route de secours pour les limites de capacité, le rate limiting et l’incompatibilité de protocole.

Conclusions clés

  • qwen3.8-flash est l’identifiant exact de l’API hébergée de cette passerelle et d’Alibaba Cloud.
  • Qwen/Qwen3.8-Flash-Next est le nom des poids ouverts et ne doit pas être utilisé comme valeur du paramètre model de l’API hébergée.
  • La version hébergée prend par défaut en charge 1M de contexte, ainsi que les entrées image, texte et vidéo et Function Calling.
  • Le modèle comprend 125B de paramètres principaux, 51B d’embedding N-gram et 6B paramètres activés par token.
  • Les benchmarks et les prix régionaux officiels doivent rester séparés des performances, du multiplicateur et du relevé de cette passerelle.
  • Le choix de production doit considérer simultanément réussite, latence, usage, réussite des outils et coût des reprises.

Questions fréquentes

Qwen3.8-Flash est-il officiellement disponible ?

Oui. L’équipe Qwen a publié les poids Flash-Next le 26 août 2026, et la page modèle officielle d’Alibaba Cloud liste l’identifiant de production qwen3.8-flash. Cette passerelle a également ouvert la route du même nom.

Quelle est la taille de contexte de Qwen3.8-Flash ?

L’API de production hébergée prend par défaut en charge 1M de contexte. Les poids ouverts Flash-Next prennent nativement en charge 262 144 tokens et peuvent être étendus à 1 000 000 tokens avec YaRN.

Qwen3.8-Flash accepte-t-il les images et les vidéos ?

Oui. La fiche officielle Alibaba Cloud mentionne des entrées image, texte et vidéo, une sortie textuelle, ainsi que Function Calling et la sortie structurée.

Qwen3.8-Flash-Next et Qwen3.8-Flash ont-ils le même identifiant ?

Non. Le premier est le nom du dépôt et des poids destinés à l’auto-hébergement ; le second est la valeur du paramètre model de l’API de production.

Qwen3.8-Flash prend-il en charge le mode réflexion ?

Oui, les modes réflexion et non-réflexion sont disponibles. Les interfaces compatibles peuvent mapper différemment les paramètres étendus ; validez d’abord la requête minimale, puis ajoutez la configuration de réflexion.

Qwen3.8-Flash fonctionne-t-il avec Claude Code ou Codex ?

Alibaba Cloud le présente comme compatible avec les protocoles OpenAI et Anthropic et cite Claude Code et Codex. Testez néanmoins les appels d’outils, le streaming, les délais et les champs d’usage dans votre environnement.

Quel est le prix officiel de Qwen3.8-Flash ?

La publication initiale de Qwen indiquait 0,16 dollar par million de tokens en entrée et 0,47 dollar en sortie ; Alibaba Cloud Model Studio affiche d’autres prix en CNY selon la région. Le multiplicateur et le relevé de cette passerelle sont indépendants : consultez la page des prix en temps réel.

Où acheter ou recharger l’API Qwen3.8-Flash ?

Les nouveaux utilisateurs peuvent commencer sur la page d’achat de l’API ; les détenteurs d’une clé peuvent utiliser la page de recharge.

Sources principales