Baseten, una plataforma de infraestructura de IA para inferença serverless y capacitación, se lanzó como un Inference Provider soportado en Hugging Face Hub el 6 de agosto de 2026. La integración permite que desarrolladores accedan e implementen modelos alojados en Baseten directamente a través de páginas de modelo de Hugging Face, SDKs de cliente (Python y JavaScript), y Agent Harnesses integradas (Pi, OpenCode, Hermes, OpenClaw). El soporte inicial cubre tareas conversacionales y generación de texto con LLMs de peso abierto populares incluyendo DeepSeek V4 Flash, GLM-5.2, Kimi K3, y otros, con soporte para tareas adicionales saliendo próximamente.
Baseten está disponible a través de dos modos de inferencia: clave API personalizada (solicitudes directas facturadas a la cuenta Baseten) y enrutadas por HF (solicitudes enrutadas a través de Hugging Face con cargos aplicados a la cuenta HF, no requiere token de proveedor). Los usuarios pueden establecer preferencias en configuración de cuenta HF para ordenar proveedores por elección y enrutar solicitudes a través de infraestructura preferida. La integración está en vivo en el SDK de Python huggingface_hub (>= 1.26.1) y el SDK de JavaScript @huggingface/inference, permitiendo integración perfecta en Agent Harnesses existentes sin código de pegamento adicional. Los usuarios HF PRO reciben $2 mensuales en créditos de Inferencia, utilizables entre proveedores; los usuarios libres obtienen cuota gratuita limitada con opción de actualizar.
Baseten se une a DeepInfra y Scaleway como Inference Providers soportados en HF, expandiendo el conjunto de opciones de inferencia de terceros de HF. Este movimiento refleja la consolidación más amplia de infraestructura de IA, donde plataformas de inferencia especializadas se integran aguas arriba en hubs de modelo y plataformas de desarrolladores para reducir fricción de despliegue. HF continúa posicionándose como una capa central de enrutamiento y agregador para inferencia de modelo a través de múltiples proveedores en lugar de un servicio monolítico de inferencia único.
Para arquitectos: este es un punto de consolidación práctico. Anteriormente, desarrolladores eligiendo Baseten sobre los Inference Endpoints nativos de HF requerían integraciones separadas y código específico del proveedor. Ahora, descubrimiento de modelo, preferencia de proveedor, agregación de facturación, e implementación todo fluye a través de una interfaz UI/SDK única. El modo de facturación enrutado-por-HF elimina fricción de bloqueo de proveedor. Espera que otros proveedores de inferencia especializados (Fireworks, Together AI, Replicate) sigan. Esto establece HF como la capa de enrutamiento de inferencia de facto para modelos abiertos, reduciendo fricción de despliegue y bloqueo de API para equipos que administran pilas multi-proveedor.