aiexpert
Início / Notícias / Nota
Breaking · 06 de ago. de 2026, 15:05 · 3 fontes

Baseten lança na Hugging Face Inference Providers; adiciona suporte para DeepSeek V4 Flash, GLM-5.2, Kimi K3

Baseten, uma plataforma de infraestrutura de IA para inferençia serverless e treinamento, lançou como um Inference Provider suportado no Hugging Face Hub em 6 de agosto de 2026. A integração permite que desenvolvedores acessem e implantem modelos hospedados na Baseten diretamente através das páginas de modelo do Hugging Face, SDKs de cliente (Python e JavaScript), e Agent Harnesses integradas (Pi, OpenCode, Hermes, OpenClaw). O suporte inicial cobre tarefas conversacionais e geração de texto com LLMs de peso aberto populares incluindo DeepSeek V4 Flash, GLM-5.2, Kimi K3, e outros, com suporte para tarefas adicionais sendo lançado em breve.

Baseten está disponível através de dois modos de inferençia: chave API customizada (requisições diretas cobradas na conta Baseten) e roteadas por HF (requisições roteadas através do Hugging Face com cobranças aplicadas à conta HF, não requer token de provedor). Os usuários podem definir preferências em configurações de conta HF para ordenar provedores por escolha e rotear requisições através de infraestrutura preferida. A integração está ao vivo no SDK Python huggingface_hub (>= 1.26.1) e SDK JavaScript @huggingface/inference, permitindo integração perfeita em Agent Harnesses existentes sem código de cola adicional. Usuários HF PRO recebem $2 mensais em créditos de Inferençia, usáveis entre provedores; usuários livres obter cota livre limitada com opção de fazer upgrade.

Baseten junta-se DeepInfra e Scaleway como Inference Providers suportados em HF, expandindo o roster de opções de inferençia de terceiros do HF. Este movimento espelha a consolidação mais ampla da infraestrutura de IA, onde plataformas de inferençia especializadas se integram upstream em hubs de modelo e plataformas de desenvolvedor para reduzir fricção de implantação. HF continua se posicionando como um roteador e agregador central de inferençia de modelo através de múltiplos provedores em vez de um único serviço monolítico de inferençia.

Para arquitetos: este é um ponto de consolidação prático. Anteriormente, desenvolvedores escolhendo Baseten sobre HF's native Inference Endpoints requeriam integrações separadas e código específico de vendedor. Agora, descoberta de modelo, preferência de vendedor, agregação de faturamento, e implantação tudo flui através de uma única interface UI/SDK. O modo faturamento roteado-por-HF remove fricção de bloqueio de vendedor. Espere que outros provedores de inferençia especializados (Fireworks, Together AI, Replicate) sigam. Isto estabelece HF como a camada de roteamento de inferençia de facto para modelos abertos, reduzindo fricção de implantação e bloqueio de API para times gerenciando pilhas multi-provedor.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source huggingface.co
  2. 02 Hugging Face Blog: Baseten on Inference Providers huggingface.co “Baseten is now a supported Inference Provider on the Hugging Face Hub”
  3. 03 Baseten org on Hugging Face Hub huggingface.co “Baseten catalog of models available on HF”