Together AI anunciou um novo modelo de implementação para inferência de modelo configurável em sua plataforma, permitindo roteamento de tráfego ciente de capacidade em múltiplas combinações de modelo + hardware. A arquitetura desacopla endpoints (identidades API fixas), implementações (modelo + configuração + réplicas) e configs (engine, tipo/contagem GPU, paralelismo, perfil de otimização). Esta separação permite rollouts de modelo sem tempo de inatividade, testes A/B, experiências de sombra e escalonamento automático sem rebalanciamento manual de peso de tráfego.
Configs são imutáveis e emparelhadas com revisões de modelo certificadas; implementações são efemerá rias e criadas/destruídas rotineiramente. Divisões de tráfego pesam cada implementação por sua contagem de réplicas prontas e peso especificado, portanto o escalonamento automático ajusta automaticamente a parcela de tráfego: uma implementação dimensionando de 1 a 3 réplicas absorve 3x tráfego proporcionalmente. O eixo de otimização permite que os usuários escolham entre latência (lotes menores, tempo-para-primeiro-token mais rápido) e throughput (lotes maiores, max tokens/GPU-hora). O catálogo de modelo público da plataforma vem com configs pré-certificados para modelos principais (Qwen, Llama, variantes GLM) com perfiamento de hardware em H100, H200, B200.
Para arquitetos: Esta é table-stakes para maturidade de plataforma de inferência— Replicate e HuggingFace Inference endpoints têm primitivos similares, mas roteamento ciente de capacidade explícito do Together é elegante. O modelo weight-per-replica significa que load-balancing e escalonamento automático se compõem naturalmente. Se a plataforma é confiável e o catálogo de config cresce, isso se torna uma forma portátil, hardware-agñostica de gerenciar inferência multi-modelo. Observe a adoção por usuários de vLLM buscando inferência gerenciada sem reconstruir orquestração.