Microsoft lanzó un tier dedicado de Gateway de IA para Azure API Management en vista previa pública, rearquitectando el plano de control alrededor de modelos y servidores MCP en lugar de rutas de API tradicionales. El gateway federa modelos de OpenAI alojado en Foundry, Anthropic, Mistral, AWS Bedrock y Google Vertex AI, con enrutamiento en coincidencia exacta de nombre de modelo para que los equipos puedan desplegar inferencia multivendor sin administrar proliferación de backend. Las herramientas se originan en servidores MCP remotos, especificaciones OpenAPI o un conector integrado que cubre 1000+ aplicaciones SaaS.
Las políticas ahora son basadas en tarjetas en el portal en lugar de XML—cubriendo límites de token/solicitud, cuotas, seguridad de contenido y fallback de modelo—y el gateway se inicia en aproximadamente un minuto sin unidades de escala para planificar. La telemetría se exporta como métricas OpenTelemetry a Application Insights, Datadog, Grafana u otros destinos que el cliente controla. El modelo operacional divide la gobernanza central (equipos de plataforma aprueban modelos y herramientas) del autoservicio de equipos (equipos de aplicaciones construyen contra activos publicados sin encaminar cambios de vuelta al centro). Una clave de acceso con alcance de gateway alcanza cada modelo y herramienta, lo que crea riesgo: los equipos familiarizados con claves por API de API Management pierden ese límite de radio de explosión.
La vista previa es calificada: sin SLA, APIs y precios no publicados, cuotas en modelos/herramientas/rendimiento sin revelar, y el tier está disponible solo en East US 2 y Sweden Central. La gobernanza de costos en el gateway fue elogiada como subestimada—la mayoría de los equipos agregan rastreo de gasto post-incidente. Pero el anuncio deja una pregunta crítica abierta: ¿quién gobierna el ciclo de vida completo del agente? El gateway puede conmutar por error e intentar nuevamente en error, pero si un agente produce salida útil antes de una finalización limpia, la anotación/preservación de ese resultado parcial no se especifica.
Para arquitectos, este es un paso hacia la gobernanza de modelo multivendor pero en etapa inicial. Sin SLA, precios no publicados y falta de claridad en semántica de ejecución de agentes significan que la adopción de producción debe esperar a GA y documentación. La clave con alcance de puerta de enlace es un riesgo material en comparación con alcance por API; los equipos necesitan orientación explícita sobre rotación de claves y compartimentalización. Observe cómo la Unity AI Gateway de Databricks (anunciada en junio, aún en beta) y la pila de administración de bedrock de AWS evolucionan en paralelo—las tres nubes ahora están todas compitiendo en esta capa de plano de control.