El Qwen3.7-Max de Alibaba se lanzó el 20 de mayo de 2026 en el Alibaba Cloud Summit de Hangzhou, y los números hablan por sí solos. Obtuvo 56,6 puntos en el Artificial Analysis Intelligence Index al momento del lanzamiento (puesto n.º 5 esa semana, actualmente en el top 10 de 151 modelos medidos), la puntuación más alta de cualquier modelo chino en ese ranking hasta la fecha. Incluye una ventana de contexto de 1 millón de tokens, cuesta $2,50 por cada millón de tokens de entrada y las pruebas internas de Alibaba reportan una ejecución autónoma de código de 35 horas que ejecutó 1.158 llamadas a herramientas y logró una aceleración de 10× respecto a la referencia estándar de Triton.
¿Es realmente mejor que GPT-5.5, Claude Opus 4.7 o Gemini 3.5? La respuesta corta: en términos de precio por inteligencia, Qwen3.7-Max es ahora uno de los modelos frontera más competitivos que puedes llamar por API. La respuesta larga tiene un matiz en cómo consigue su puntuación en alucinaciones que conviene conocer antes de confiarle tu flujo de trabajo. Analizamos los benchmarks publicados, extrajimos los precios oficiales y desglosamos lo que este lanzamiento significa para el espacio de codificación, agentes y herramientas de IA a mediados de 2026.
Los puntos clave
- Qwen3.7-Max obtiene 56,6 puntos en el Artificial Analysis Intelligence Index, posicionado en el top 10 global y con la puntuación más alta de un modelo chino hasta la fecha
- Ventana de contexto de 1 millón de tokens y una salida máxima de 65.536 tokens, con razonamiento extendido activado por defecto
- El precio de la API es de $2,50 entrada / $7,50 salida por cada millón de tokens, con la entrada en caché a $0,25 por millón (90 % de descuento)
- Demostró 35 horas de codificación autónoma continua, 1.158 llamadas a herramientas y una aceleración geométrica de 10× respecto al kernel de referencia de Triton
- Modelo propietario (sin pesos abiertos), disponible en Alibaba Cloud Model Studio, OpenRouter e integración directa con Claude Code a través del protocolo de la API de Anthropic
¿Qué es Qwen3.7-Max?
Qwen3.7-Max es el modelo de razonamiento propietario insignia de Alibaba, diseñado como una «base para agentes» más que como un asistente de chat general. Es el sucesor de Qwen3.6 Max Preview y el primer modelo Qwen en superar la barrera del millón de tokens de contexto, saltando desde los 256K. Utiliza razonamiento por cadena de pensamiento extendido por defecto y está posicionado para competir directamente con GPT-5.5, Claude Opus 4.7 y Gemini 3.5 Flash en tareas que requieren autonomía de largo alcance.
Junto a Qwen3.7-Max, Alibaba presentó sin mayor fanfarria el Qwen3.7-Plus-Preview, una variante multimodal que añade entrada de visión y opera a un precio más bajo. Plus es la opción económica para cargas de trabajo rutinarias de gran volumen, mientras que Max es el más potente para razonamiento, codificación con agentes y contextos a escala documental. A diferencia de muchas versiones anteriores de Qwen, ninguno de los dos modelos es de pesos abiertos; ambos funcionan únicamente a través de la API alojada de Alibaba. En junio de 2026, el gobierno de la ciudad de Río de Janeiro lanzó Rio 3.5 Open 397B, un ajuste fino de pesos abiertos que se compara con Qwen 3.7 Plus en los benchmarks.
Benchmarks: cómo se compara Qwen3.7-Max
Los números del lanzamiento son sólidos en todos los frentes. Según Artificial Analysis, Qwen3.7-Max se sitúa entre Gemini 3.5 Flash y Claude Opus 4.7 en el Intelligence Index general, pero supera su peso en algunos benchmarks de razonamiento exigentes.
| Modelo | AA Intelligence Index | Entrada $/M | Salida $/M | Contexto |
|---|---|---|---|---|
| GPT-5.5 | 60,2 | $5.00 | $30.00 | 1M |
| Claude Opus 4.7 | 57,3 | $5.00 | $25.00 | 1M |
| Qwen3.7-Max | 56,6 | $2.50 | $7.50 | 1M |
| Gemini 3.5 Flash | 55,3 | $1.50 | $9.00 | 1M |
| DeepSeek V4 Pro | 52,0 | $1.74 | $3.48 | 1M |
En benchmarks individuales, Qwen3.7-Max logra 92,4 puntos en GPQA Diamond (por delante de Claude Opus 4.6 Max con 91,3, por detrás de GPT-5.5 con 93,6) y 97,1 en HMMT 2026 February, la puntuación más alta de su grupo de comparación. También obtiene 44,5 en Apex (muy por encima de DeepSeek V4 Pro con 38,3), 80,4 en SWE-Verified para tareas de ingeniería de software, y 41,4 en Humanity's Last Exam, superando por poco a Opus 4.6 Max con 40,0.
La salvedad honesta: la baja tasa de alucinaciones de Qwen3.7-Max se debe en parte a una mayor abstención. Según el análisis de benchmarks de Officechai, la tasa de intentos del modelo cayó al 48,0 %, la más baja entre los modelos frontera comparables. En términos simples, rechaza responder con más frecuencia, lo que reduce las respuestas incorrectas pero también reduce la utilidad en casos límite. Ese intercambio importa si lo vas a integrar en un agente que necesita avanzar a pesar de la ambigüedad.
Precios: $2,50 entrada, $7,50 salida, $0,25 en caché
Qwen3.7-Max es uno de los modelos frontera con mejor relación calidad-precio del mercado ahora mismo. La API cuesta $2,50 por millón de tokens de entrada y $7,50 por millón de tokens de salida, con una salida máxima de 65.536 tokens por solicitud. La entrada en caché baja a $0,25 por millón de tokens, un 90 % de descuento que abarata las llamadas repetidas de contexto largo.
$0,25 por entrada en caché es la funcionalidad estrella
Para flujos de trabajo con agentes que releen la misma base de código, documento o historial de chat durante cientos de turnos, el descuento de caché convierte a Qwen3.7-Max en una rareza en términos de precio. Claude Opus 4.7 cobra $5 por millón de tokens de entrada y $25 de salida, el doble en entrada y más del triple en salida respecto a Qwen3.7-Max. GPT-5.5 cuesta $5 de entrada y $30 de salida, el más caro del grupo. Gemini 3.5 Flash ($1,50/$9) y DeepSeek V4 Pro ($1,74/$3,48) son más económicos, pero obtienen puntuaciones más bajas en benchmarks de razonamiento. Si tu carga de trabajo es «contexto largo, muchas llamadas a herramientas, pensamiento ocasional», Qwen3.7-Max ocupa el punto óptimo entre inteligencia frontera y precio frontera.
Dónde puedes contratarlo
La API está disponible en Alibaba Cloud Model Studio, OpenRouter y Together AI, y Qwen Chat (chat.qwen.ai) ofrece acceso de vista previa gratuito limitado a través de la web. No existe un nivel gratuito permanente, y la variante Plus-Preview es solo texto en la API aunque acepta imágenes a través de la interfaz de chat.
La ejecución autónoma de 35 horas, explicada
La demo principal del lanzamiento fue la ejecución autónoma de código continua de 35 horas, y merece un análisis más detallado porque la mayoría de los artículos del lanzamiento pasaron por alto lo que realmente ocurrió. Según las pruebas internas de Alibaba (aún no se ha publicado verificación independiente), a Qwen3.7-Max se le asignó un servidor aislado equipado con un acelerador de IA Zhenwu M890, una arquitectura de hardware completamente nueva que el modelo nunca había visto durante el entrenamiento. La tarea consistía en optimizar un kernel de atención desde cero.
Durante 35 horas seguidas, el modelo ejecutó 1.158 llamadas a herramientas distintas, realizó 432 evaluaciones del kernel, diagnosticó fallos de compilación por su cuenta y reescribió su código de forma iterativa. Terminó con una aceleración de media geométrica de 10× sobre la implementación de referencia de Triton, según VentureBeat. Esa demo por sí sola no es prueba de inteligencia de agente general, pero sí demuestra que el modelo puede mantener el contexto, recuperarse de fallos y seguir siendo coherente durante un período en el que la mayoría de los demás modelos de razonamiento empiezan a alucinar variables o a entrar en bucles.
Para los desarrolladores, la conclusión práctica es esta: si vas a ejecutar un agente de codificación o un asistente de investigación durante toda la noche, Qwen3.7-Max es ahora uno de los pocos modelos probados a esa duración. Si tu presupuesto aguanta el gasto en tokens es una pregunta aparte.
Dónde probar Qwen3.7-Max
Hay cuatro formas de empezar a usarlo y tu elección depende de si quieres una interfaz de chat, una API o un harness de agentes.
Qwen Chat (chat.qwen.ai) es el punto de entrada de vista previa gratuita. Tiene un límite diario de mensajes y expone tanto Qwen3.7-Max como Qwen3.7-Plus-Preview a través de un menú desplegable. Es útil para probarlo antes de comprometerte con el gasto de API.
Alibaba Cloud Model Studio es el hogar oficial de la API con todos los precios aplicados y los límites de contexto más amplios. Necesitarás una cuenta de Alibaba Cloud, lo que implica más fricción que otros proveedores, pero permite el almacenamiento en caché de prompts y soporte directo.
OpenRouter ofrece el modelo al mismo nivel de precios y es más fácil de registrar, especialmente si ya estás enrutando varios modelos a través de una sola clave. Together AI también lo aloja para cargas de trabajo orientadas al ajuste fino.
Claude Code es el que sorprendió a muchos. Qwen3.7-Max admite de forma nativa el protocolo de la API de Anthropic, lo que significa que puedes apuntar Claude Code, OpenClaw o cualquier otro harness compatible con Anthropic al endpoint de Qwen y usarlo como reemplazo directo. Si el precio te ha alejado de Claude Code pero quieres el mismo flujo de trabajo, esta es la alternativa más económica y creíble a la que has tenido acceso en meses.
Si prefieres saltarte la configuración de la API y comparar modelos frontera desde una sola app, la app Fello AI para Mac e iOS incluye Claude, ChatGPT, Gemini, Grok y DeepSeek bajo una sola suscripción de $9,99/mes, para que puedas hacer pruebas A/B de prompts entre proveedores sin gestionar cuentas de facturación separadas.
Veredicto: ¿deberías cambiarte?
Qwen3.7-Max es el modelo frontera chino más sólido lanzado hasta la fecha, y el precio lo convierte en la opción natural para trabajo agente y de contexto largo con presupuesto ajustado. Si tu cuello de botella son las facturas de la API de GPT-5.5 o Claude Opus 4.7, esta es la forma más directa de reducir el gasto sin caer en la categoría de «Gemini 3.5 Flash, pero algo peor en razonamiento».
Deberías cambiarte si estás creando agentes que funcionan durante horas, si manejas contextos de un millón de tokens o si necesitas la tarifa de $0,25 por entrada en caché para que un caso de uso sea rentable. No deberías cambiarte si tu carga de trabajo depende de visión multimodal completa (usa Plus-Preview o espera a Max-Vision), o si tu aplicación no puede tolerar la mayor tasa de abstención en preguntas difíciles. En inteligencia bruta pura y seguimiento de instrucciones en la frontera absoluta, GPT-5.5 sigue liderando el Intelligence Index, pero la brecha de precio se está ampliando.
La historia más grande es lo que este lanzamiento señala. Alibaba está enviando ahora un modelo propietario que se conecta directamente a su propio acelerador de IA personalizado (el Zhenwu M890) y a su servidor a escala de rack (Panjiu AL128), en la misma semana, en el mismo escenario. Esa es la apuesta de IA de pila completa hacia la que también corren NVIDIA y OpenAI, y Alibaba es el primer proveedor chino en sumarse de forma creíble a esa carrera. Qwen3.7-Max es la capa de modelo de esa apuesta, y con los números que tenemos, la apuesta está dando frutos.
Para el panorama más amplio de cómo los laboratorios chinos de IA alcanzaron este nivel tan rápido, nuestro análisis en profundidad sobre la carrera de IA china y nuestro artículo sobre Kimi K2.5 te dan el contexto previo. Si estás buscando los mejores modelos de codificación gratuitos, Qwen3.7-Max no es gratuito, pero merece la comparación por benchmark/dólar. Para lo último en esa línea, consulta nuestra guía sobre Kimi K2.7 Code, el modelo de codificación de pesos abiertos más reciente de Moonshot.
Qwen no es el único movimiento frontera chino de este mes. MiniMax presentó MiniMax M3, un LLM de atención dispersa que afirma aceleraciones de 9,7× y 15,6× en el umbral de 1 millón de tokens respecto a M2.5, lo que indica que la eficiencia en contexto largo, no solo la escala bruta, es el nuevo campo de batalla para los laboratorios chinos.
FAQ
¿Es Qwen3.7-Max de código abierto?
No. Qwen3.7-Max es propietario y sus pesos no están publicados. Solo está disponible a través de Alibaba Cloud Model Studio, OpenRouter y Together AI. Los modelos anteriores de la familia Qwen 3.6 siguen siendo de pesos abiertos en Hugging Face.
¿Cuánto cuesta Qwen3.7-Max?
La API cuesta $2,50 por millón de tokens de entrada y $7,50 por millón de tokens de salida, con un 90 % de descuento en la entrada en caché a $0,25 por millón.
¿Funciona Qwen3.7-Max con Claude Code?
Sí. El modelo admite de forma nativa el protocolo de la API de Anthropic, por lo que puedes apuntar Claude Code, OpenClaw o cualquier harness compatible con Anthropic directamente al endpoint de Qwen como reemplazo directo.
¿Es Qwen3.7-Max mejor que GPT-5.5?
En el Artificial Analysis Intelligence Index, GPT-5.5 sigue liderando con 60,2 frente a los 56,6 de Qwen3.7-Max. En precio por inteligencia y en codificación autónoma de largo alcance, Qwen3.7-Max es la opción más sólida.
¿Cuál es la diferencia entre Qwen3.7-Max y Qwen3.7-Plus-Preview?
Max es el modelo insignia de razonamiento de solo texto con los benchmarks más altos y el mayor contexto. Plus-Preview es multimodal (entrada de visión) y tiene un precio orientado a cargas de trabajo de mayor volumen y menor criticidad.