aiexpert
Início / Notícias / Nota
Research · 14 de ago. de 2026, 16:08 · 4 fontes

Z.ai GLM-5.3: ganhos de codificação de horizonte longo de 6x, cyber emergente 84,5% (CyberGym) de post-treinamento sozinho em base congelada de 743B

Z.ai lançou GLM-5.3 em 14 de agosto de 2026, alcançando grandes ganhos em codificação e cibersegurança sem retreinar o modelo base. O modelo de 743B parâmetros roda na base idêntica a GLM-5.2 (59 dias antes); toda melhoria reportada vem de post-treinamento escalado: vastamente mais ambientes de tarefas de horizonte longo (alguns equivalentes a dias de trabalho de engenharia especializada), diversidade de ambiente mais rica, e duração de treinamento RL estendida. Terminal-Bench 3.0 saltou de 4,6% para 28,3% (ganho de 6x), DeepSWE v1.1 de 46,2% para 66,9% (+20 pontos), e Code Bench interno de Z.ai mostra 50% melhoria em alto esforço. Na métrica de Z.ai, GLM-5.3 alcança 31,4% precisão com ~50K tokens de saída por tarefa, superando Claude Opus 4.8 (29,5% em 120K tokens) enquanto consome 60% menos tokens.

Capacidades de cibersegurança emergiram inesperadamente como um subproduto não planejado. Z.ai adicionou ambientes de descoberta de vulnerabilidade ao post-treinamento esperando ganhos de bug-finding localizado; em vez disso, o modelo começou a formar planos de exploração coerentes em múltiplos estágios. CyberGym (descoberta de vulnerabilidade white-box) atingiu 84,5%, liderando a tabela de comparação de Z.ai e Mythos 5 (83,8%) e GPT-5.6 Sol (83,6%). ExploitBench (exploração de CVE do mundo real) dobrou para 54,4% (acima de 24,4%). Em ExploitGym, GLM-5.3 completou 130 casos em 6 horas e 105 em 2 horas. Pesos são retidos por ~2 semanas (fim de agosto de 2026) aguardando avaliação de segurança, com acesso API e níveis do GLM Coding Plan ao vivo agora.

Para arquitetos: post-treinamento escalado como alternativa ao pré-treinamento é a história sub-o-radar. Se escalonamento de tarefas acionado por RL pode mover uma base congelada de 6 meses por 6x em code-gen, o cálculo de ROI da indústria muda de mega-rodadas de pré-treinamento para infraestrutura de RL pós-treinamento e geração de tarefas sintéticas. GLM-5.3 troca algum desempenho de codificação de primeira linha (fica atrás de Fable 5 em avaliações mais duras) por comportamento de segurança emergente e eficiência (menos tokens, mesma precisão vs. Opus). O lançamento atrasado de peso aberto—revertendo o padrão MIT-license-em-dias de GLM-5.2—sinaliza gestão de risco de dual-use. Para equipes de segurança: custo-por-vulnerabilidade com GLM-5.3 local é ~7x menor do que equivalentes Gemini/Fable uma vez que pesos caem.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source marktechpost.com
  2. 02 marktechpost.com marktechpost.com “Z.ai just released GLM-5.3. GLM-5.3 runs on the same 743B base model as GLM-5.2. Every reported gain comes from scaled post-training: more task environments, more environment types, longer training.”
  3. 03 marktechpost.com marktechpost.com “Coding jumps most on the longest-horizon benchmarks, with Terminal-Bench 3.0 moving from 4.6 to 28.3. Cybersecurity moved further than Z.ai says it expected, with CyberGym reaching 84.5%.”
  4. 04 marktechpost.com marktechpost.com “On Z.ai Code Bench, an internal evaluation, the company reports a 50% improvement over GLM-5.2. It reports 31.4% at roughly 50,000 output tokens per task. Claude Opus 4.8 scores 29.5% at 120,000 tokens.”