aiexpert
Início / Notícias / Nota
Chips · 29 de jul. de 2026, 00:34 · 4 fontes

AMD e Cerebras se unem em inferência de IA desagregada; reclamam ganhos de eficiência de 5x

AMD e Cerebras anunciaram uma parceria técnica para fornecer uma plataforma desagregada de inferência de IA combinando sistemas rackscale AMD Helios com o Cerebras Wafer-Scale Engine (WSE). Revelada no Advancing AI 2026 em 23 de julho, a solução conjunta emparelha o Helios de alto rendimento da AMD (72 GPUs MI455X por rack, 31TB HBM4) com o WSE-3 de ultra-baixa latência da Cerebras (900.000 núcleos, 44GB SRAM on-die). Juntos, eles afirmam até 5x maiores tokens por segundo por watt versus configurações WSE apenas da Cerebras.

AMD Helios lía o estágio de contexto/preenchimento—processando prompts e grandes janelas de contexto em alto rendimento—enquanto Cerebras WSE acelera o estágio de decodificação/geração intensiva de memória com latência sub-10ms por token. Essa abordagem desagregada espelha a estratégia NVIDIA Rubin CPX, mas inverte a especialização: AMD visa rendimento, Cerebras visa latência. O resultado é posicionado para aplicações priorizando interação em tempo real: copiões, agentes ao vivo, fluxos de trabalho autônomos e descoberta científíca.

Cerebras planeja implantar AMD Helios em seus próprios data centers, com a solução conjunta esperada estar disponível inicialmente por meio da Cerebras Cloud em H2 2026. Para arquitetos: essa parceria aborda um gargalo real—NVIDIA Rubin também buscou desagregação pela mesma razão. A questão para compradores é a paridade de recursos e o ecossistema de software. AMD e Cerebras devem demonstrar que a inferência mista entre Helios + WSE corresponde à facilidade de pilhas de fornecedor único, particularmente para equipes migrando de NVIDIA.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source cerebras.ai
  2. 02 cerebras.ai cerebras.ai
  3. 03 ir.amd.com ir.amd.com
  4. 04 tomshardware.com tomshardware.com