Alibaba Qwen3.8: modelo multimodal de 2.4T afirma "segundo apenas para Fable 5" — nenhum benchmark publicado
O time Qwen da Alibaba visualizou o Qwen3.8-Max em 19 de julho na Conferência Mundial de IA em Shangai, afirmando que classifica segundo apenas o Fable 5 da Anthropic. O modelo carrega 2,4 trilhões de parâmetros totais em um design esparso de Mixture-of-Experts (MoE) e é o primeiro modelo Qwen acima de 1 trilhão de parâmetros a ser multimídia, manipulando texto, imagens, vídeo e documentos. As ações da Alibaba subiram até 5,4% no anúncio. A afirmação vem três dias após o rival chinês Moonshot lançar Kimi K3, também 2,8 trilhões de parâmetros, marcando uma voleia rápida de lançamentos multi-trilhões de parâmetros de laboratórios chineses.
O problema: Alibaba publicou zero scores de benchmark, nenhum modelo card e nenhuma avaliação independente para apoiar o ranking "segundo apenas para Fable 5". O anúncio permanece como o posicionamento da própria empresa. Para contexto, Qwen3.7-Max, o flagship anterior, marcou 56.6 no Índice de Inteligência da Análise de Inteligência Artificial (5º lugar geral, modelo chinês de melhor classificação) e 60.6 no SWE-Bench Pro—aproximadamente 20 pontos atrás do 80.4 do Fable 5 no mesmo teste. Qwen3.8 é acessível através do Token Plan da Alibaba em 10% do preço padrão, com pesos abertos "prometidos em breve".
Isso espelha um padrão recente: Kimi K3 encabeçou o leaderboard de codificação front-end da Arena.ai mas depois mostrou taxas de alucinação de ~51% em tarefas de recuperação de conhecimento, ilustrando a lacuna entre benchmarks de anúncio e confiabilidade de produção. Nenhum leaderboard independente—não o Open LLM da Hugging Face, Análise de Inteligência ou Arena.ai—tem marcado Qwen3.8 ainda. O timing sublinha o impulso da China por afirmações visíveis de paridade de fronteira seguindo anúncios de modelos dos EUA e europeus (GPT-5.6 em 9 de julho, Bristol Myers em Vera Rubin, arrecadação de €3B da Mistral).
Para arquitetos: trate isso como um sinal de capacidade genuína *emparelhado com* uma bandeira de caução. O desempenho anterior de Qwen3.7-Max torna "segundo apenas para Fable 5" não absurdo, mas não verificado até que avaliações de terceiros cheguem. O lançamento de pesos abertos será o ponto de prova. Até então, a contagem real de parâmetros ativos do modelo, custo de inferência e perfil de sobrecarga de token permanecem desconhecidos—críticos para planejamento de custo-por-tarefa em produção.