aiexpert
Inicio / Noticias / Nota
Research · 11 ago 2026, 06:03 · 4 fuentes

Meta Llama 4 Scout alcanza ventana de contexto de 10M; Maverick 400B MoE supera GPT-4.5 en benchmarks

<cite index="56-1,56-2">Meta lanzó modelos Llama 4 Scout y Maverick con pesos abiertos; a mediados de 2026, Behemoth aún está en vista previa/entrenamiento interno con números de benchmark iniciales mostrando que supera GPT-4.5, Claude 3.7 Sonnet y Gemini 2.0 Pro en tareas de razonamiento STEM</cite>. <cite index="60-2">Llama 4 Scout cuenta con 17 mil millones de parámetros activos, 16 expertos y 109 mil millones de parámetros totales, mientras que Maverick tiene 17 mil millones de parámetros activos, 128 expertos y 400 mil millones de parámetros totales</cite>. <cite index="60-3">Scout logra una ventana de contexto de 10 millones de tokens sin precedentes, muy por encima de la ventana de contexto de 128K de Llama 3, permitiendo procesar libros completos o bases de códigos en un solo prompt</cite>.

<cite index="51-2">Llama 4 usa capas alternas densas y de mezcla de expertos (MoE) para eficiencia de inferencia, con 128 expertos enrutados y un experto compartido, permitiendo que solo un subconjunto de parámetros totales se active mientras se sirve; Maverick puede ejecutarse en un único host NVIDIA H100 DGX para fácil implementación o inferencia distribuida</cite>. <cite index="60-4">Meta entrena usando precisión FP8 sin sacrificar calidad, logrando 390 TFLOPs/GPU mientras preentrenaba el modelo Behemoth en 32K GPUs, y desarrolló MetaP, una nueva técnica de entrenamiento que establece confiablemente hiperparámetros críticos como tasas de aprendizaje por capa</cite>.

<cite index="60-1">Llama 4 Maverick ofrece una relación de precio-rendimiento aproximadamente 9-23x mejor en comparación con GPT-4o mientras mantiene un rendimiento comparable o mejor en la mayoría de los benchmarks</cite>. Sin embargo, <cite index="58-2">las comunidades de código abierto no estaban completamente satisfechas con el costo e intensidad de memoria de los modelos MoE dispersos, que precios para participantes en GPUs limitadas en comparación con alternativas densas a menor escala como Qwen 2.5</cite>.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source explainx.ai
  2. 02 ai.meta.com ai.meta.com “Llama 4 Scout, a 17 billion active parameter model with 16 experts, is the best multimodal model in the world in its class and processes 10 million tokens of context”
  3. 03 explainx.ai explainx.ai “Meta has shared early benchmark numbers showing it outperforms GPT-4.5, Claude 3.7 Sonnet, and Gemini 2.0 Pro on STEM reasoning tasks”
  4. 04 dinmaybrahma.medium.com dinmaybrahma.medium.com “Llama 4 Maverick offers approximately 9–23x better price-performance ratio compared to GPT-4o while maintaining comparable or better performance on most benchmarks”