Z.ai lanzó GLM-5.3 el 14 de agosto de 2026, logrando grandes ganancias en codificación y ciberseguridad sin retrenar el modelo base. El modelo de 743B parámetros se ejecuta en la base idéntica a GLM-5.2 (59 días antes); todas las mejoras reportadas vienen de post-entrenamiento escalado: vastamente más ambientes de tareas de horizonte largo (algunos equivalentes a días de trabajo de ingeniería especializada), diversidad de entorno más rica, y duración de entrenamiento RL extendida. Terminal-Bench 3.0 saltó de 4.6% a 28.3% (ganancia de 6x), DeepSWE v1.1 de 46.2% a 66.9% (+20 puntos), y Code Bench interno de Z.ai muestra 50% mejora en alto esfuerzo. En la métrica de Z.ai, GLM-5.3 logra 31.4% precisión con ~50K tokens de salida por tarea, superando Claude Opus 4.8 (29.5% en 120K tokens) mientras consume 60% menos tokens.
Las capacidades de ciberseguridad emergieron inesperadamente como un subproducto no planeado. Z.ai añadió ambientes de descubrimiento de vulnerabilidad al post-entrenamiento esperando ganancias localizadas de búsqueda de errores; en su lugar, el modelo comenzó a formar planes de explotación coherentes en múltiples etapas. CyberGym (descubrimiento de vulnerabilidad white-box) alcanzó 84.5%, liderando la tabla de comparación de Z.ai y Mythos 5 (83.8%) y GPT-5.6 Sol (83.6%). ExploitBench (explotación de CVE del mundo real) se duplicó a 54.4% (desde 24.4%). En ExploitGym, GLM-5.3 completó 130 casos en 6 horas y 105 en 2 horas. Los pesos se retienen durante ~2 semanas (finales de agosto de 2026) pendiente de evaluación de seguridad, con acceso API y niveles del GLM Coding Plan en vivo ahora.
Para arquitectos: post-entrenamiento escalado como alternativa al pre-entrenamiento es la historia sub-el-radar. Si el escalamiento de tareas impulsado por RL puede mover una base congelada de 6 meses por 6x en code-gen, el cálculo de ROI de la industria cambia de mega-rondas de pre-entrenamiento a infraestructura de RL post-entrenamiento y generación de tareas sintéticas. GLM-5.3 intercambia algo del rendimiento de codificación de primera línea (queda atrás de Fable 5 en evaluaciones más duras) por comportamiento de seguridad emergente y eficiencia (menos tokens, misma precisión vs. Opus). El lanzamiento retrasado de peso abierto—invirtiendo el patrón MIT-licencia-en-días de GLM-5.2—señala gestión de riesgo de dual-use. Para equipos de seguridad: costo-por-vulnerabilidad con GLM-5.3 local es ~7x menor que equivalentes Gemini/Fable una vez que se cae el peso.