Alibaba lançou Qwen3.8-Max em 3 de agosto de 2026, um modelo de mistura esparsa de especialistas com 2,4 trilhões de parâmetros com 95 bilhões de parâmetros ativos por token, janela de contexto de 1 milhão de tokens e entrada multimodal (texto, imagem, vídeo). O modelo está disponível via API no QwenCloud e Alibaba Cloud Model Studio em $2 por milhão de tokens de entrada, $6 por milhão de saída e $0,25 de entrada em cache. Alibaba se comprometeu a lançar pesos de código aberto em uma semana, tornando Qwen3.8-Max o primeiro modelo de classe Max que Alibaba jamais abriu a código aberto. Um Qwen3.8-27B menor também está indo aberto.
Em benchmarks Arena.AI no lançamento, Qwen3.8-Max classificou-se quinto no Text Arena e segundo no Vision Arena globalmente. A carta de escore de benchmark própria de Alibaba mostra 86,6 em Terminal-Bench 2.1 (acima de Claude Opus 4.8 em 84,6, mas abaixo de GPT-5.6 Sol em 88,8), 92,6 em GPQA Diamond e 67,7 em SWE-bench Pro (versus Claude Fable 5 em 80,0). Os ganhos importantes são em raciocínio multimodal e agentic, não puro raciocínio. Alibaba afirma que Qwen3.8-Max fica apenas atrás de Claude Fable 5 geral, embora verificação de terceiros (Artificial Analysis, LMArena) não o tenha classificado no início de agosto.
Qwen3.8-Max demonstra raciocínio agentic estendido: Alibaba mostrou que está autonomamente codificando e iterando um arnesso de software auto-evoluíno em 10+ dias com feedback do usuário, e reproduzindo um artigo de pesquisa de aprendizado de máquina de ponta a ponta com 33 rodadas de treinamento de GPU (125 horas de parede) e 7.600 linhas de código gerado. Quando entrado em um concurso de codificação ao vivo com 526 equipes humanas, venceu 87% do campo. O tratamento multimodal inclui sumarizando documentos de 100 páginas ou livestreams de 100 horas em bases de conhecimento pesquisáveis.
Para arquitetos: preços de API de $2/$6 (versus Claude Opus 5 em $30, GPT-5.6 Sol em $35) torna isto agressivamente suço para trabalho agentic/multimodal, mas auto-hospedagem do modelo completo de 2,4T-parâmetro quando os pesos são enviados exigirá implementação de datacenter de múltiplos nós. O checkpoint aberto de 27B é o caminho realista no local. Benchmarking de terceiros ainda está faltando; benchmarks auto-relatados de Alibaba (Terminal-Bench, GPQA) carecem de coriobação independente no início de agosto. Assuma paridade com Fable 5 para fins de planejamento até que Artificial Analysis ou LMArena publiquem pontuações.