O Qwen3.7-Max da Alibaba foi lançado a 20 de maio de 2026 na Cimeira da Alibaba Cloud em Hangzhou, e os números falam por si. Obteve 56,6 no Artificial Analysis Intelligence Index no momento do lançamento (o 5.º classificado nessa semana, atualmente no top 10 de 151 modelos avaliados), sendo o modelo de IA chinês mais bem classificado neste ranking até à data. Tem uma janela de contexto de 1 milhão de tokens, custa $2.50 por 1M de tokens de entrada, e os testes internos da Alibaba reportam uma execução autónoma de programação de 35 horas que efetuou 1.158 chamadas de ferramentas e atingiu uma aceleração de 10× face ao referencial padrão Triton.
Então, é realmente melhor do que o GPT-5.5, o Claude Opus 4.7 ou o Gemini 3.5? Resposta curta: em termos de preço por inteligência, o Qwen3.7-Max é agora um dos modelos de fronteira mais competitivos que se pode aceder via API. Resposta longa: há uma nuance na forma como obtém a pontuação de alucinações que convém conhecer antes de apostar o seu fluxo de trabalho nele. Analisámos os benchmarks divulgados, consultámos os preços oficiais e desvendámos o que este lançamento significa para o espaço de programação, agentes e ferramentas de IA a caminho de meados de 2026.
Os Pontos Essenciais
- O Qwen3.7-Max obtém 56,6 no Artificial Analysis Intelligence Index, classificado no top 10 a nível global e a melhor posição alguma vez alcançada por um modelo chinês
- Janela de contexto de 1 milhão de tokens e saída máxima de 65.536 tokens, com raciocínio alargado ativado por defeito
- O preço da API é de $2.50 de entrada / $7.50 de saída por 1M de tokens, com entrada em cache a descer para $0.25 por 1M (desconto de 90%)
- Demonstrou 35 horas de programação autónoma contínua, 1.158 chamadas de ferramentas e uma aceleração geométrica de 10× face ao kernel de referência Triton
- Modelo proprietário (sem pesos abertos), disponível via Alibaba Cloud Model Studio, OpenRouter e integração direta com o Claude Code através do protocolo da API da Anthropic
O Que É o Qwen3.7-Max?
O Qwen3.7-Max é o modelo de raciocínio proprietário topo de gama da Alibaba, concebido como uma «base para agentes» em vez de um assistente de conversação genérico. É o sucessor do Qwen3.6 Max Preview e o primeiro modelo Qwen a ultrapassar a barreira do contexto de 1M de tokens, subindo dos 256K anteriores. Utiliza por defeito raciocínio de cadeia de pensamento alargado e está posicionado para competir diretamente com o GPT-5.5, o Claude Opus 4.7 e o Gemini 3.5 Flash em tarefas que exigem autonomia a longo prazo.
A par do Qwen3.7-Max, a Alibaba lançou discretamente o Qwen3.7-Plus-Preview, uma variante multimodal que adiciona entrada de imagem e funciona a um preço mais acessível. O Plus é a opção económica para cargas de trabalho de grande volume e rotineiras, enquanto o Max é o modelo pesado para raciocínio, programação com agentes e contextos à escala de documentos. Ao contrário de muitos lançamentos anteriores da Qwen, nenhum dos modelos tem pesos abertos; ambos funcionam exclusivamente através da API alojada da Alibaba. Em junho de 2026, o governo da cidade do Rio de Janeiro lançou o Rio 3.5 Open 397B, um modelo de ajuste fino com pesos abertos que se compara ao Qwen 3.7 Plus.
Benchmarks: Como se Posiciona o Qwen3.7-Max
Os números do lançamento são sólidos em todos os domínios. Segundo a Artificial Analysis, o Qwen3.7-Max situa-se entre o Gemini 3.5 Flash e o Claude Opus 4.7 no Intelligence Index global, mas supera as expectativas em alguns benchmarks de raciocínio mais exigentes.
| Modelo | AA Intelligence Index | Entrada $/M | Saída $/M | Contexto |
|---|---|---|---|---|
| GPT-5.5 | 60,2 | $5.00 | $30.00 | 1M |
| Claude Opus 4.7 | 57,3 | $5.00 | $25.00 | 1M |
| Qwen3.7-Max | 56,6 | $2.50 | $7.50 | 1M |
| Gemini 3.5 Flash | 55,3 | $1.50 | $9.00 | 1M |
| DeepSeek V4 Pro | 52,0 | $1.74 | $3.48 | 1M |
Nos benchmarks individuais, o Qwen3.7-Max obtém 92,4 no GPQA Diamond (à frente do Claude Opus 4.6 Max com 91,3, atrás do GPT-5.5 com 93,6) e 97,1 no HMMT 2026 February, a pontuação mais alta do seu grupo de comparação. Obtém ainda 44,5 no Apex (bem à frente do DeepSeek V4 Pro com 38,3), 80,4 no SWE-Verified para tarefas de engenharia de software, e 41,4 no Humanity's Last Exam, superando ligeiramente o Opus 4.6 Max com 40,0.
A ressalva honesta: a baixa taxa de alucinações do Qwen3.7-Max é em parte resultado de uma maior abstenção. Segundo a análise de benchmarks da Officechai, a taxa de tentativas do modelo caiu para 48,0%, a mais baixa entre os modelos de fronteira comparáveis. Em termos simples, o modelo recusa-se a responder com mais frequência, o que reduz as respostas erradas mas também reduz a utilidade em casos ambíguos. Esta troca é relevante se o integrar num agente que precisa de avançar perante ambiguidade.
Preços: $2.50 de Entrada, $7.50 de Saída, $0.25 em Cache
O Qwen3.7-Max é um dos modelos de fronteira com melhor relação qualidade/preço no mercado atualmente. A API custa $2.50 por 1 milhão de tokens de entrada e $7.50 por 1 milhão de tokens de saída, com uma saída máxima de 65.536 tokens por pedido. A entrada em cache desce para $0.25 por 1M de tokens, um desconto de 90% que torna baratas as chamadas repetidas com contexto longo.
$0.25 de entrada em cache é a funcionalidade diferenciadora
Para fluxos de trabalho com agentes que releem a mesma base de código, documento ou histórico de conversação em centenas de turnos, o desconto de cache transforma o Qwen3.7-Max numa exceção em termos de preço. O Claude Opus 4.7 cobra $5 por 1M de tokens de entrada e $25 de saída, o dobro da entrada e mais do triplo da saída do Qwen3.7-Max. O GPT-5.5 custa $5 de entrada e $30 de saída, o mais caro do grupo. O Gemini 3.5 Flash ($1.50/$9) e o DeepSeek V4 Pro ($1.74/$3.48) são mais baratos, mas obtêm pontuações mais baixas nos benchmarks de raciocínio. Se a sua carga de trabalho é «contexto longo, muitas chamadas de ferramentas, raciocínio ocasional», o Qwen3.7-Max ocupa o ponto ideal entre inteligência de fronteira e preços de fronteira.
Onde pode aceder
A API está disponível no Alibaba Cloud Model Studio, no OpenRouter e no Together AI, com o Qwen Chat (chat.qwen.ai) a oferecer acesso de pré-visualização limitado e gratuito via web. Não existe nível gratuito permanente, e a variante Plus-Preview aceita apenas texto na API, embora aceite entrada de imagem através da interface de conversação.
A Execução Autónoma de 35 Horas, Explicada
A demonstração principal do lançamento é a execução autónoma de programação contínua de 35 horas, que merece uma análise mais cuidada porque a maioria dos artigos sobre o lançamento não aprofundou o que realmente aconteceu. Segundo os testes internos da Alibaba (ainda não foi publicada qualquer verificação independente), o Qwen3.7-Max foi colocado num servidor isolado equipado com um acelerador de IA Zhenwu M890, uma arquitetura de hardware completamente nova que o modelo nunca tinha visto em treino. A tarefa era otimizar um kernel de atenção de raiz.
Ao longo de 35 horas seguidas, o modelo executou 1.158 chamadas de ferramentas distintas, realizou 432 avaliações de kernel, diagnosticou falhas de compilação de forma autónoma e reescreveu o seu código iterativamente. Terminou com uma aceleração de 10× na média geométrica face à implementação de referência Triton, segundo o VentureBeat. Esta demonstração isolada não é prova de inteligência geral de agente, mas mostra que o modelo consegue manter o contexto, recuperar de falhas e permanecer coerente ao longo de uma duração em que a maioria dos outros modelos de raciocínio começa a alucinar variáveis ou a entrar em ciclos.
Para os programadores, a conclusão prática é esta: se estiver a executar um agente de programação ou um assistente de investigação durante a noite, o Qwen3.7-Max é agora um dos poucos modelos testados a esta duração. Se a sua carteira consegue acompanhar o gasto em tokens é uma questão separada.
Onde Experimentar o Qwen3.7-Max
Existem quatro formas de começar a usar o modelo, e a escolha depende de pretender uma interface de conversação, uma API ou um ambiente de agentes.
O Qwen Chat (chat.qwen.ai) é o ponto de entrada gratuito de pré-visualização. Tem um limite diário de mensagens e expõe tanto o Qwen3.7-Max como o Qwen3.7-Plus-Preview através de um menu. Útil para experimentar antes de se comprometer com gastos de API.
O Alibaba Cloud Model Studio é a sede oficial da API, com preços completos aplicados e os limites de contexto mais alargados. É necessária uma conta na Alibaba Cloud, o que implica mais passos do que noutros fornecedores, mas permite cache de prompts e suporte direto.
O OpenRouter disponibiliza o modelo ao mesmo nível de preço e é mais fácil de registar, especialmente se já encaminhar vários modelos através de uma única chave. O Together AI também o aloja para cargas de trabalho com ajuste fino.
O Claude Code é a opção que surpreendeu. O Qwen3.7-Max suporta nativamente o protocolo da API da Anthropic, o que significa que pode apontar o Claude Code, o OpenClaw ou qualquer outro ambiente compatível com Anthropic para o endpoint da Qwen e usá-lo como substituto direto. Se os preços do Claude Code estão além do seu orçamento mas quer manter o mesmo fluxo de trabalho, esta é a alternativa mais credível e acessível que teve à disposição nos últimos meses.
Se preferir ignorar a configuração da API e comparar modelos de fronteira numa só aplicação, a aplicação Fello AI para Mac e iOS agrupa o Claude, o ChatGPT, o Gemini, o Grok e o DeepSeek numa subscrição de $9.99/mês, permitindo testar prompts A/B entre fornecedores sem gerir contas de faturação separadas.
Veredicto: Vale a Pena Mudar?
O Qwen3.7-Max é o modelo de fronteira chinês mais credível lançado até à data, e os preços tornam-no a escolha natural para trabalho com agentes e contexto longo sensível aos custos. Se o seu bottleneck são as faturas da API do GPT-5.5 ou do Claude Opus 4.7, esta é a forma mais direta de reduzir gastos sem descer para a categoria «Gemini 3.5 Flash, mas ligeiramente pior no raciocínio».
Vale a pena mudar se estiver a construir agentes que funcionam durante horas, a gerir contextos de um milhão de tokens, ou se precisar da taxa de $0.25 de entrada em cache para tornar um caso de uso rentável. Não vale a pena mudar se a sua carga de trabalho depender de visão multimodal completa (use o Plus-Preview ou aguarde o Max-Vision), ou se a sua aplicação não tolerar a maior taxa de abstenção em questões difíceis. Para inteligência bruta e seguimento de instruções na fronteira absoluta, o GPT-5.5 ainda lidera no Intelligence Index, mas a diferença de preço está a aumentar.
A história mais ampla é o que este lançamento sinaliza. A Alibaba está agora a lançar um modelo proprietário diretamente ligado ao seu próprio acelerador de IA personalizado (Zhenwu M890) e ao servidor em rack (Panjiu AL128), na mesma semana, no mesmo palco. Esta é a aposta full-stack em IA que a NVIDIA e a OpenAI também perseguem, e a Alibaba é o primeiro fornecedor chinês a entrar credencialmente nessa corrida. O Qwen3.7-Max é a camada de modelo dessa aposta, e com os números de que dispomos, a aposta está a dar frutos.
Para o contexto mais amplo sobre como os laboratórios de IA chineses recuperaram tão rapidamente, o nosso artigo de fundo sobre a corrida de IA chinesa e o nosso texto sobre o Kimi K2.5 fornecem o contexto anterior. Se estiver à procura dos melhores modelos de programação gratuitos, o Qwen3.7-Max não é gratuito, mas vale a pena comparar em termos de benchmark por dólar. Para o mais recente nessa linha, consulte o nosso guia sobre o Kimi K2.7 Code, o mais recente modelo de programação com pesos abertos da Moonshot.
A Qwen não é a única jogada chinesa de fronteira deste mês. A MiniMax apresentou em pré-visualização o MiniMax M3, um LLM de atenção esparsa que reivindica acelerações de 9,7× e 15,6× no patamar de 1M de tokens face ao M2.5, sinalizando que a eficiência em contexto longo, e não apenas a escala bruta, é o novo campo de batalha para os laboratórios chineses.
FAQ
O Qwen3.7-Max é open source?
Não. O Qwen3.7-Max é proprietário e os pesos não estão disponíveis publicamente. Está acessível apenas através do Alibaba Cloud Model Studio, do OpenRouter e do Together AI. Os modelos anteriores da família Qwen 3.6 continuam a ter pesos abertos no Hugging Face.
Quanto custa o Qwen3.7-Max?
A API custa $2.50 por 1M de tokens de entrada e $7.50 por 1M de tokens de saída, com um desconto de 90% na entrada em cache a $0.25 por 1M.
O Qwen3.7-Max funciona com o Claude Code?
Sim. O modelo suporta nativamente o protocolo da API da Anthropic, pelo que pode apontar o Claude Code, o OpenClaw ou qualquer ambiente compatível com Anthropic diretamente para o endpoint da Qwen como substituto direto.
O Qwen3.7-Max é melhor do que o GPT-5.5?
No Artificial Analysis Intelligence Index, o GPT-5.5 ainda lidera com 60,2 contra 56,6 do Qwen3.7-Max. Em termos de preço por inteligência e programação autónoma a longo prazo, o Qwen3.7-Max é a opção mais vantajosa.
Qual é a diferença entre o Qwen3.7-Max e o Qwen3.7-Plus-Preview?
O Max é o modelo topo de gama de raciocínio apenas com texto, com os benchmarks mais altos e o maior contexto. O Plus-Preview é multimodal (entrada de imagem) e tem preços pensados para cargas de trabalho de maior volume e menor criticidade.