Las startups de infraestructura de inferencia administrada han atraído capital rcord mientras las empresas se alejan de modelos fronterizos propietarios hacia alternativas de código abierto optimizadas por costo. Fireworks AI cerró una Serie D de $1.505 mil millones el 16 de julio de 2026, con una valuación de $17.5 mil millones—un aumento de 4.4x de su precio de $4 mil millones hace apenas nueve meses. La ronda, liderada por Atreides Management, Index Ventures y TCV, llevó el financiamiento total de Fireworks a ~$1.83 mil millones y vino después de que la empresa divulgara más de $1 mil millón en tasa de ejecución de ingresos anualizados y 40 billones de tokens de IA servidos por día.
Together AI y Baseten cerraron rondas grandes en cuestiones de semanas. Together AI recaudó $800 millones el 1 de julio de 2026, a $8.3 mil millones, con reservas anuales que superan $1.15 mil millones y 500+ megavatios de compromisos de capacidad de cómputo independiente prometidos por inversores para respaldar el crecimiento. Baseten cerró una recaudación de $1.5 mil millones en junio a $13 mil millones, con estimaciones de Sacra sugiriendo ~$600 millones ARR en marzo de 2026 (múltiplo de ingresos de 22x). Estas tres empresas colectivamente cerraron cerca de $3.8 mil millones en capital fresco en solo cuatro semanas, señalando confianza de los inversores de que el servicio de modelos de código abierto se ha movido de experimental a infraestructura de grado de producción.
El cambio es impulsado por dos fuerzas: (1) el Índice de IA 2026 de Stanford coloca la brecha de desempeño de modelo cerrado-abierto en solo 3.3%, reducido de 0.5% en agosto de 2024, significando que los premios de precio de modelo cerrado son más difíciles de justificar; y (2) los clientes están construyendo IA de dominio específice y propietaria en lugar de alquilar API fronterizas genéricas. Fireworks informa que el 95% de sus tokens proviene de modelos que los clientes han personalizado en sus propios datos. Los compradores empresariales informan cortar costos de inferencia de 6x a 60x frente a laboratorios fronterizos mientras igualan o superan la calidad de desempeño.
Para arquitectos y equipos de adquisiciones, esto señala un cambio estructural en el gasto de IA empresarial. La capa de inferencia—no solo entrenamiento—ahora comanda una parte significativa de presupuestos de capital. Los márgenes brutos siguen siendo la variable a observar (Fireworks informa ~50% vs. 70%+ para SaaS, debido a costos de GPU), pero el crecimiento sostenido de ingresos de 5x YoY y 40+ billones de tokens/día de rendimiento sugieren que la economía unitaria se está sosteniendo. Los hiperscaladores (AWS, Azure, Google Cloud) competirán a través de ofertas nativas, pero la diferenciación de startups se centra en flexibilidad de despliegue, soporte de modelo personalizado y garantías de costos en cargas de trabajo de producción.