DeepSeek lançou V4-Flash (284B parâmetros totais, 13B ativos) em 31 de julho de 2026, com desempenho comparável ao Claude Opus 4.8 da Anthropic em codificação complexa e tarefas de software autônomas, enquanto cobrava dramaticamente menos. V4-Flash custa aproximadamente 28 centavos por unidade de saída vs. $25 para o mesmo do Opus 4.8—uma vantagem de preço de 99%. Na lista de classificação de codificação front-end de Arena.ai crowdsourced, V4-Flash debutou à frente de Opus 4.8 apesar de seu preço bargain, sinalizando que a economia da inferência de modelo foi invertida: capacidade e preço estão se desacoplando.
O lançamento V4 segue um colapso de preços de escala completa em modelos de fronteiriça em julho de 2026. OpenAI cortou o preço de GPT-5.6 Luna em 80% apenas três semanas após o lançamento; Google lançou três novos modelos Gemini 'flash' focados em eficiência; Meta reverteu sua estratégia de pesos abertos com Muse Spark 1.1 fechado-fonte preçado agressivamente para desenvolvedores. Apenas Anthropic manteve preços premium em modelos Claude de nível superior, apostando que as empresas pagarão extra por segurança e interpretabilidade—uma aposta contrarian em meio à corrida pela liderança de custos.
Para equipes de infraestrutura, isso sinaliza o fim da economia do modelo-como-fossó. Desde meados de 2025, o preço do modelo de fronteiriça comprimiu de $0,50/M tokens para centavos de um só dígito, e V4-Flash de 13B parâmetro ativo da DeepSeek prova que a capacidade se dimensiona eficientemente sem contagens de mega-parâmetro. Equipes que constroem pilhas de inferência de produção, sistemas RAG e fluxos de trabalho agéntica agora têm alavancagem de preços conforme o locus de diferenciação muda de licenciamento de modelo para integração, confiabilidade e ajuste fino específ ico de domínio.