aiexpert
Inicio / Noticias / Nota
Research · 14 ago 2026, 18:34 · 5 fuentes

Alibaba abre pesos Qwen3.8-27B: modelo multimodal de 27B para inferencia local en GPU única, licenciado Apache 2.0

Alibaba lanzó pesos abiertos para Qwen3.8-27B, un modelo multimodal denso de 27 mil millones de parámetros que supera a su predecesor Qwen3.7-Plus y destaca en flujos de trabajo de codificación y oficina. El modelo admite entradas de texto, imagen y vídeo de forma nativa y viene con ventana de contexto de 262K tokens extensible a 1M vía YaRN. Bajo licencia Apache 2.0, la versión 27B se posiciona como la capa de auto-hospedaje práctica de la familia Qwen3.8, complementando el Qwen3.8-Max (2.4 billones de parámetros, solo API/hospedado).

Qwen3.8-27B está diseñado para inferencia local de GPU única dirigido a hardware consumer con ~24GB VRAM (clase RTX 4090). En cuantización de 4 bits, el modelo se ajusta a despliegues realistas con ~16–17 GB de carga útil de peso más caché KV (~20–24 GB de VRAM total en la práctica). Los constructores de la comunidad publicaron inmediatamente compilaciones GGUF en Hugging Face; Unsloth lanzó GGUF dinámicos horas después del anuncio, permitiendo inferencia sin dependencias externas.

Este es un cambio estratégico para Alibaba: los modelos Qwen Max anteriores (3.6-Plus, 3.7-Max, 3.7-Plus) se mantuvieron propietarios/solo API. La generación 3.8 vuelve a la licencia Apache 2.0 abierta que caracterizó los lanzamientos iniciales de Qwen, extendiendo esa apertura a ambos niveles Max y 27B. El lanzamiento se produce en medio de una intensificación de la competencia en el mercado de inferencia local, donde Llama 3.1, Nemotron y modelos abiertos de DeepSeek compiten por la atención de desarrolladores.

Para arquitectos de infraestructura en producción: esto elimina la dependencia de la nube (latencia, costo, bloqueo de proveedor, residencia de datos). La capacidad multimodal abre análisis de documentos (extracción de PDF/gráficos), comprensión de contenido de vídeo y asistentes de codificación visual. El desempeño de codificación heredado de las ganancias de entrenamiento de la generación 3.8 sugiere un uso sólido de herramientas y razonamiento de agentes a escala 27B, abordando la brecha entre destilaciones de 7B y requisitos de 70B+ parámetros. Espere adopción rápida en industrias reguladas (finanzas, atención médica) donde la inferencia en las instalaciones es crítica para el cumplimiento.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source x.com
  2. 02 Alibaba Qwen on X: Qwen3.8-27B open weights released x.com “We promised open weights for Qwen3.8. Now, time to meet them! Qwen3.8-27B: A native multimodal dense model. With just 27B parameters, it outperforms Qwen3.7-Plus overall and shines in real-world coding & office workflows.”
  3. 03 Crypto Briefing: Alibaba releases open weights for Qwen3.8-27B multimodal model cryptobriefing.com “Alibaba designed this model for practical local inference, targeting hardware with around 24GB of VRAM, the kind of GPU memory found in a high-end consumer graphics card like an NVIDIA RTX 4090”
  4. 04 Crypto Briefing: Alibaba releases open weights for Qwen3.8-27B multimodal model cryptobriefing.com “The 27B model sits at the lighter end of Alibaba's new Qwen3.8 family. Its bigger sibling, the Qwen3.8-Max, features 2.4 trillion total parameters”
  5. 05 Crypto Briefing: Alibaba releases open weights for Qwen3.8-27B multimodal model cryptobriefing.com “Local deployment capability matters because it removes dependency on cloud providers, reduces latency, keeps sensitive data on-premise, and drops the cost of experimentation”