aiexpert
Inicio / Noticias / Nota
Research · 14 ago 2026, 16:08 · 4 fuentes

Z.ai GLM-5.3: ganancias de codificación de horizonte largo de 6x, cyber emergente 84.5% (CyberGym) de post-entrenamiento solo en base congelada de 743B

Z.ai lanzó GLM-5.3 el 14 de agosto de 2026, logrando grandes ganancias en codificación y ciberseguridad sin retrenar el modelo base. El modelo de 743B parámetros se ejecuta en la base idéntica a GLM-5.2 (59 días antes); todas las mejoras reportadas vienen de post-entrenamiento escalado: vastamente más ambientes de tareas de horizonte largo (algunos equivalentes a días de trabajo de ingeniería especializada), diversidad de entorno más rica, y duración de entrenamiento RL extendida. Terminal-Bench 3.0 saltó de 4.6% a 28.3% (ganancia de 6x), DeepSWE v1.1 de 46.2% a 66.9% (+20 puntos), y Code Bench interno de Z.ai muestra 50% mejora en alto esfuerzo. En la métrica de Z.ai, GLM-5.3 logra 31.4% precisión con ~50K tokens de salida por tarea, superando Claude Opus 4.8 (29.5% en 120K tokens) mientras consume 60% menos tokens.

Las capacidades de ciberseguridad emergieron inesperadamente como un subproducto no planeado. Z.ai añadió ambientes de descubrimiento de vulnerabilidad al post-entrenamiento esperando ganancias localizadas de búsqueda de errores; en su lugar, el modelo comenzó a formar planes de explotación coherentes en múltiples etapas. CyberGym (descubrimiento de vulnerabilidad white-box) alcanzó 84.5%, liderando la tabla de comparación de Z.ai y Mythos 5 (83.8%) y GPT-5.6 Sol (83.6%). ExploitBench (explotación de CVE del mundo real) se duplicó a 54.4% (desde 24.4%). En ExploitGym, GLM-5.3 completó 130 casos en 6 horas y 105 en 2 horas. Los pesos se retienen durante ~2 semanas (finales de agosto de 2026) pendiente de evaluación de seguridad, con acceso API y niveles del GLM Coding Plan en vivo ahora.

Para arquitectos: post-entrenamiento escalado como alternativa al pre-entrenamiento es la historia sub-el-radar. Si el escalamiento de tareas impulsado por RL puede mover una base congelada de 6 meses por 6x en code-gen, el cálculo de ROI de la industria cambia de mega-rondas de pre-entrenamiento a infraestructura de RL post-entrenamiento y generación de tareas sintéticas. GLM-5.3 intercambia algo del rendimiento de codificación de primera línea (queda atrás de Fable 5 en evaluaciones más duras) por comportamiento de seguridad emergente y eficiencia (menos tokens, misma precisión vs. Opus). El lanzamiento retrasado de peso abierto—invirtiendo el patrón MIT-licencia-en-días de GLM-5.2—señala gestión de riesgo de dual-use. Para equipos de seguridad: costo-por-vulnerabilidad con GLM-5.3 local es ~7x menor que equivalentes Gemini/Fable una vez que se cae el peso.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source marktechpost.com
  2. 02 marktechpost.com marktechpost.com “Z.ai just released GLM-5.3. GLM-5.3 runs on the same 743B base model as GLM-5.2. Every reported gain comes from scaled post-training: more task environments, more environment types, longer training.”
  3. 03 marktechpost.com marktechpost.com “Coding jumps most on the longest-horizon benchmarks, with Terminal-Bench 3.0 moving from 4.6 to 28.3. Cybersecurity moved further than Z.ai says it expected, with CyberGym reaching 84.5%.”
  4. 04 marktechpost.com marktechpost.com “On Z.ai Code Bench, an internal evaluation, the company reports a 50% improvement over GLM-5.2. It reports 31.4% at roughly 50,000 output tokens per task. Claude Opus 4.8 scores 29.5% at 120,000 tokens.”