Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Volver al blog

Guía de precios e integración de la API Qwen3.8-Flash 2026: contexto multimodal 1M

Qwen3.8-FlashAPI de QwenQwen Flashagente de programacióncontexto 1M

El 27 de agosto de 2026, un día después de que se publicaran los pesos abiertos de Qwen3.8-Flash-Next, preparamos la documentación de integración para la ruta qwen3.8-flash que esta pasarela acaba de habilitar. El error más habitual está en el propio nombre: los pesos abiertos y la API de producción no utilizan el mismo ID de modelo.

Qwen/Qwen3.8-Flash-Next es un MoE multimodal de código abierto para previsualizar la arquitectura Qwen4; qwen3.8-flash es el modelo de API de producción que ofrecen Alibaba Cloud Model Studio y QwenCloud. Admite de forma predeterminada contexto 1M, entradas de imagen/texto/vídeo, Function Calling y salida estructurada. Esta pasarela ya ha habilitado la ruta qwen3.8-flash; su multiplicador y el cargo real deben consultarse en la página de precios en tiempo real y en la factura de la solicitud.

El artículo separa la arquitectura del modelo abierto, las capacidades oficiales de la API de Alibaba Cloud, los precios oficiales de acceso directo y la ruta de esta pasarela. Los benchmarks publicados por el equipo de Qwen no son una medición independiente de este sitio, y los precios regionales de Alibaba Cloud no se pueden convertir directamente en un multiplicador de esta pasarela.

Datos clave de Qwen3.8-Flash

Elemento Información verificada
Fecha de lanzamiento oficial 26 de agosto de 2026
ID de la API en esta pasarela / Model Studio qwen3.8-flash
ID de los pesos abiertos Qwen/Qwen3.8-Flash-Next
Estructura de parámetros Modelo principal de 125B + 51B de N-gram Embedding, 6B activos
Contexto API de producción: 1M de forma predeterminada; versión abierta: 262.144 nativos, ampliables a 1M con YaRN
Entrada / salida Imagen, texto y vídeo como entrada; texto como salida
Capacidades de la API Function Calling, salida estructurada, Web Search y caché de contexto
Posicionamiento público Agentes de programación, automatización ofimática, visión y flujos de alto rendimiento
Multiplicador de esta pasarela No se fija en el artículo; consulta los precios en tiempo real y la factura

Información comprobada por última vez el 27 de agosto de 2026. Antes de pasar a producción, vuelve a revisar la lista de modelos, la documentación regional de Model Studio y los campos de uso de la respuesta real.

¿Qué relación hay entre Qwen3.8-Flash y Qwen3.8-Flash-Next?

El equipo de Qwen publicó primero los pesos de Qwen3.8-Flash-Next para que la comunidad pudiera estudiar la arquitectura anunciada para Qwen4. Después, la versión de producción se ofreció con el nombre Qwen3.8-Flash. Comparten una orientación técnica, pero la forma de llamarlos es distinta.

Nombre Uso ID exacto Contexto
Qwen3.8-Flash-Next Alojamiento propio, investigación de arquitectura y evaluación open source Qwen/Qwen3.8-Flash-Next 262.144 nativos, ampliables a 1M con YaRN
Qwen3.8-Flash API de producción alojada qwen3.8-flash 1M de forma predeterminada
Qwen3.8-Max Modelo alojado de gama alta qwen3.8-max 1M

Si llamas a esta pasarela o a una interfaz compatible de Alibaba Cloud, no escribas el nombre del repositorio de Hugging Face en el parámetro model. A la inversa, en un despliegue propio no basta con escribir el ID de la API alojada para que el framework descargue los pesos automáticamente.

¿Cuál es la nueva arquitectura de Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next combina Gated DeltaNet (GDN) y Qwen Sparse Attention (QSA) en una atención híbrida. GDN comprime el historial en un estado de tamaño fijo, mientras QSA utiliza un indexador ligero para seleccionar los bloques importantes del contexto. Así se reducen el cálculo de atención y los accesos a KV Cache en secuencias largas.

También incorpora Gated Residual (GR), que amplía el flujo residual a cuatro ramas y utiliza puertas dinámicas para controlar la lectura y la escritura. N-gram Embedding consulta el contexto local en una tabla y aumenta la capacidad del modelo sin añadir demasiada computación matricial por token. El entrenamiento utiliza una versión mejorada de Muon Optimizer y vuelve a ajustar la Scaling Law.

El tamaño anunciado es de 125B para el modelo principal, 51B adicionales de N-gram Embedding y 6B de parámetros activos por token. El equipo de Qwen afirma que el coste de entrenamiento equivale aproximadamente a una novena parte del de Qwen3.7-Plus; es una comparación de entrenamiento del proveedor, no una medición del coste de inferencia de esta pasarela.

¿Qué límites tienen el contexto 1M y la multimodalidad?

La página del modelo Qwen3.8-Flash de Alibaba Cloud indica una longitud de contexto de 1.000.000 de tokens: entrada máxima de 991.808 en modo normal y 983.616 en modo de razonamiento, salida máxima de 131.072 y longitud máxima de la cadena de razonamiento de 262.144. Las imágenes, el texto y los vídeos se pueden enviar como entrada; la salida es texto.

1M no significa que todas las solicitudes deban acercarse a un millón de tokens. Las instrucciones del sistema, los esquemas de herramientas, la codificación de imágenes y vídeos, el historial de mensajes y la salida reservada ocupan la ventana; una solicitud muy larga también aumenta la latencia y el coste. En producción, empieza midiendo tramos de 32K, 128K, 256K y contexto largo.

La tabla oficial de capacidades también incluye Function Calling, salida estructurada, Web Search y caché de contexto. Batch está disponible en la región de Pekín, pero aparece como no disponible en Singapur. Las diferencias regionales deben verificarse por separado antes del despliegue.

¿Cómo interpretar los benchmarks oficiales de programación y agentes de Qwen?

El equipo de Qwen compara Qwen3.8-Flash-Next con Qwen3.8-27B, Qwen3.7-Plus y DeepSeek-V4-Flash-0731. Estos son cuatro resultados publicados:

Evaluación publicada por el proveedor Qwen3.7-Plus Qwen3.8-Flash-Next Tipo de tarea
DeepSWE 1.1 16.5 58.7 Programación con agentes
SWE-bench Multilingual 75.8 81.0 Ingeniería de software multilingüe
CoWorkBench 65.1 73.9 Tareas ofimáticas de larga duración
Toolathlon Verified 50.6 73.5 Llamadas reales a herramientas

Estas puntuaciones proceden de la publicación oficial de Qwen y no son una medición independiente de esta pasarela. La versión del modelo, el presupuesto de razonamiento, el entorno de herramientas y el evaluador influyen mucho en el resultado. En particular, no conviertas las cifras de Flash-Next de código abierto en la capacidad de extremo a extremo de la API alojada en tu cliente, región y cuota.

¿Cómo separar el precio oficial de Qwen3.8-Flash del precio de esta pasarela?

En su publicación inicial, Qwen indicó que la versión de producción de QwenCloud tenía como referencia 0,16 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida; la misma publicación decía entonces que la API se abriría próximamente. Después, la página de Alibaba Cloud Model Studio incluyó el ID de llamada qwen3.8-flash y precios y tablas de capacidades en CNY distintos según Pekín, Singapur y otras regiones.

Ambas cifras son precios del acceso directo oficial y pueden cambiar según región, caché, Batch o promociones. Esta pasarela no convierte directamente el precio oficial en dólares ni el precio regional de Model Studio en un multiplicador del gateway. El multiplicador, la caché y el cargo real de qwen3.8-flash son los que aparecen en la página de precios en tiempo real y en la factura de la solicitud.

Los nuevos usuarios pueden empezar con un importe pequeño en la página de compra de la API; quienes ya tienen una clave pueden añadir saldo en la página de recarga. Fija el prompt y el tamaño de contexto, registra los tokens de entrada, salida y caché y compara después el coste real.

¿Cómo llamar a la API de Qwen3.8-Flash?

Esta pasarela ofrece una interfaz Chat Completions compatible con OpenAI. El ID exacto del modelo es qwen3.8-flash:

curl https://api.llm-token.cn/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash",
    "messages": [
      {
        "role": "user",
        "content": "Summarize the failing tests, then propose the smallest safe patch."
      }
    ]
  }'

Qwen3.8-Flash admite modos de razonamiento y sin razonamiento, pero cada capa compatible puede mapear de forma diferente enable_thinking, reasoning_effort, los parámetros de streaming de herramientas y las herramientas integradas. Empieza con una solicitud de texto mínima y añade por separado razonamiento, imágenes, vídeo, herramientas y contexto largo; no envíes todos los parámetros extendidos de una vez.

¿Para qué tareas es adecuado Qwen3.8-Flash?

  • agentes de programación de alto rendimiento, revisión de código y análisis de pruebas fallidas
  • repositorios de código multilingües y tareas de ingeniería de software similares a SWE-bench
  • automatización ofimática de larga duración para correos, hojas de cálculo, documentos y reuniones
  • comprensión de imágenes, gráficos y vídeos largos
  • flujos de trabajo con Function Calling, salida estructurada y Web Search
  • documentos largos y repositorios grandes que necesitan contexto 1M con un presupuesto controlado
  • investigación de la arquitectura de Qwen4 previsualizada mediante alojamiento propio y adaptación de frameworks de inferencia

Para decisiones de arquitectura complejas, auditorías de seguridad críticas o tareas puntuales de alto valor, compara también con Qwen3.8-Max, GLM-5.3, Claude u otro modelo potente. El valor de Flash está en la relación entre coste y rendimiento, no en sustituir todas las evaluaciones por un único modelo.

¿Qwen3.8-Flash o Qwen3.8-Max?

Si el volumen es alto y necesitas multimodalidad, llamadas a herramientas y contexto 1M, empieza validando Qwen3.8-Flash con una pequeña parte del tráfico. Si la prioridad es el límite superior del razonamiento complejo, la tolerancia a errores y la calidad de una salida crítica, ejecuta la misma prueba con Qwen3.8-Max.

No compares solo una respuesta. Mide como mínimo la tasa de tareas completadas, la latencia del primer token, la duración total, la tasa de éxito de herramientas, los tokens de entrada y salida, los aciertos de caché y el número de repeticiones. Un modelo barato por token puede acabar costando más si necesita más reintentos.

Lista de comprobación para producción

  1. Usa qwen3.8-flash para la API alojada y Qwen/Qwen3.8-Flash-Next para alojamiento propio.
  2. Fija el repositorio, el prompt, la versión de las herramientas, el tiempo de espera y el comando de aceptación antes de comparar.
  3. Valida por separado los modos de razonamiento y sin razonamiento y registra las diferencias de formato.
  4. Prueba por separado texto, imágenes, vídeo, Function Calling y salida estructurada.
  5. Mide la latencia y la factura por tramos de 32K, 128K, 256K y contexto largo.
  6. Comprueba que la región elegida admite Batch, caché y las herramientas integradas necesarias.
  7. Define límites para llamadas a herramientas, salida máxima, presupuesto total y acciones externas.
  8. Prepara una ruta de respaldo ante límites de capacidad, rate limiting o incompatibilidad de protocolo.

Conclusiones clave

  • qwen3.8-flash es el ID exacto de la API alojada de Alibaba Cloud y de esta pasarela.
  • Qwen/Qwen3.8-Flash-Next es el nombre de los pesos abiertos y no debe utilizarse como valor de model en la API alojada.
  • La versión alojada admite de forma predeterminada contexto 1M, entradas de imagen, texto y vídeo y Function Calling.
  • El modelo tiene 125B de parámetros principales, 51B de N-gram Embedding y 6B de parámetros activos por token.
  • Los benchmarks y precios regionales oficiales deben mantenerse separados del rendimiento, multiplicador y factura de esta pasarela.
  • Para elegir en producción hay que considerar a la vez tasa de éxito, latencia, uso, éxito de herramientas y coste de repetición.

Preguntas frecuentes

¿Qwen3.8-Flash está disponible oficialmente?

Sí. El equipo de Qwen publicó los pesos Flash-Next el 26 de agosto de 2026 y la página oficial del modelo de Alibaba Cloud ya muestra el ID de producción qwen3.8-flash. Esta pasarela también ha habilitado la ruta con el mismo nombre.

¿Qué tamaño de contexto tiene Qwen3.8-Flash?

La API de producción alojada admite por defecto contexto 1M. Los pesos abiertos Flash-Next admiten de forma nativa 262.144 tokens y se pueden ampliar hasta 1.000.000 con YaRN.

¿Qwen3.8-Flash admite imágenes y vídeos?

Sí. La tabla oficial de capacidades de Alibaba Cloud indica entradas de imagen, texto y vídeo, salida de texto, Function Calling y salida estructurada.

¿Qwen3.8-Flash-Next y Qwen3.8-Flash tienen el mismo ID?

No. El primero es el nombre del repositorio y de los pesos para alojamiento propio; el segundo es el valor del parámetro model de la API de producción.

¿Qwen3.8-Flash admite el modo de razonamiento?

Admite los modos de razonamiento y sin razonamiento. Las interfaces compatibles pueden mapear de forma diferente los parámetros extendidos; valida primero una solicitud mínima y después añade la configuración de razonamiento.

¿Qwen3.8-Flash funciona con Claude Code o Codex?

Alibaba Cloud lo presenta como compatible con los protocolos OpenAI y Anthropic y menciona Claude Code y Codex. Aun así, prueba las llamadas a herramientas, el streaming, los tiempos de espera y los campos de uso en tu entorno.

¿Cuál es el precio oficial de Qwen3.8-Flash?

La publicación inicial de QwenCloud indicó 0,16 dólares por millón de tokens de entrada y 0,47 dólares por millón de salida; Alibaba Cloud Model Studio ofrece otros precios en CNY según la región. El multiplicador y la factura de esta pasarela son independientes: consulta la página de precios en tiempo real.

¿Dónde comprar o recargar la API de Qwen3.8-Flash?

Los nuevos usuarios pueden comenzar en la página de compra de la API; quienes ya tienen una clave pueden utilizar la página de recarga.

Fuentes principales