aiexpert
Início / Notícias / Nota
Market · 13 de ago. de 2026, 11:02 · 3 fontes

Together AI faz parceria com IBM e NVIDIA para cluster de inferência de código aberto de $240M; afirma aceleração de 2x em Blackwell

Together AI e IBM assinaram um acordo de infraestrutura multianual de $240 milhões em 11 de agosto para construir um cluster de inferência de IA de código aberto em larga escala no IBM Cloud alimentado por sistemas NVIDIA HGX B300 e rede Spectrum-X. O cluster é o primeiro cluster de inferência dedicado em larga escala no IBM Cloud usando esta configuração de hardware; a disponibilidade é direcionada para Q1 2027. Together AI relatou servir 400 trilhões de tokens mensalmente e fechou recentemente uma Série C de $800 milhões em $8,3 bilhões de avaliação.

Together AI afirma rankings de velocidade de inferência #1 em modelos de código aberto na arquitetura NVIDIA Blackwell, alcançando até 2x velocidade de saída mais rápida do que provedores concorrentes para modelos Qwen, DeepSeek e Kimi. A empresa atribui ganhos de desempenho a um mecanismo de inferência totalmente modernizado otimizado para hardware Blackwell, decodificação especulativa avançada (ATLAS), e quantização de baixo bit (FP4/FP8). Para DeepSeek-V4-Flash, Together AI oferece desempenho 13% mais rápido do que o próximo provedor mais rápido. Together também garantiu compromissos para 500+ megawatts de capacidade de compute financiados independentemente por investidores para suportar crescimento esperado.

Para engenheiros e arquitetos avaliando provedores de inferência de código aberto: a parceria IBM de Together AI e otimização Blackwell representam uma mudança significativa na economia de inferência de commodities. As afirmações de aceleração de 2x (onde validadas em sua carga de trabalho) traduzem-se diretamente em custos de token mais baixos; em escala, isso se mistura. No entanto, a data de lançamento Q1 2027 significa que implantações existentes devem avaliar desempenho em seus próprios modelos e padrões de tráfego hoje. A mensagem de mercado implícita é que curvas de custo de inferência continuam caindo mais rápido para modelos abertos com kernels construídos para o propósito—e que hiperscalers e provedores de plataforma (IBM, NVIDIA, Together) estão apostando pesadamente nesta tendência para impulsionar adoção de compute em nuvem longe de APIs proprietárias.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source newsroom.ibm.com
  2. 02 newsroom.ibm.com newsroom.ibm.com “Together AI will use this cluster to provide open-source model inference. This deployment is the first dedicated, large-scale cluster built for inference on IBM Cloud using HGX B300 systems and NVIDIA Spectrum-XTM Ethernet networking.”
  3. 03 together.ai together.ai “We achieved over 13% faster serverless inference performance for DeepSeek-R1-0528 when compared with the next fastest provider.”