Todo sistema de RL com recompensa verificável para agentes de linguagem bate na mesma parede: o pool de ambientes para de crescer. Tarefas curadas manualmente se esgotam; as sintetizadas estaticamente congelam a distribuição de objetivos no momento da criação; pipelines com verificadores congelados não podem se adaptar quando o modelo supera a tarefa mais difícil pré-configurada. SPADE, publicado no arXiv em 19 de agosto por uma equipe de 18 autores da UW, CMU e colaboradores, ataca esse gargalo ao mesclar o designer de ambiente e o agente de raciocínio em uma política compartilhada.

Um único LLM desempenha dois papéis. Como Environment Designer, escreve programas Python completos—MDPs executáveis com interfaces reset()/step(), transições de estado, funções de recompensa e código de verificação—fundamentados em trechos de um corpus de pré-treinamento e uma memória acumulada de ambientes gerados anteriormente. Como Reasoning Agent, percorre esses programas. Ambos os papéis atualizam uma política compartilhada via GRPO; não há modelo separado de designer ou agente.

O sinal de recompensa previne colapso através de arrependimento baseado em dica: a lacuna entre o retorno do episódio do agente com uma dica privilegiada e sem ela. Alto arrependimento marca a fronteira de aprendizado—tarefas que o agente resolve com ajuda mas não sozinho. Baixo arrependimento mais altos retornos marcam maestria; baixo arrependimento mais baixos retornos marcam um ambiente intratável pelo qual o designer é penalizado. Essa distinção de três vias impede que SPADE degenere em um puro adversário que gera tarefas insolúveis.

Ablações mostram as dependências críticas. Remova o fundamento do corpus e o designer não consegue ancorar novos ambientes a conceitos reais. Remova a memória do ambiente e ele regenera tarefas redundantes. Desative completamente o treinamento do designer e a linha de base se satura. Em jogos, SPADE melhora através de todos os 400 passos de treinamento enquanto linhas de base de ambiente fixo se estabilizam. A progressão curricular é visível nos logs divulgados: na etapa 4, um ambiente executa 173 linhas com 11 variáveis de estado e o agente de 30B resolve 31 de 32 tentativas em média de 3.7 turnos; na etapa 304, um ambiente executa 1.012 linhas com 13 variáveis de estado e o mesmo agente usa todos os 12 turnos permitidos em cada uma das 32 tentativas.

Na escala de 30B (Qwen3-30B-A3B-Instruct), SPADE entrega um ganho médio de +5.3 em relação à linha de base de ambiente fixo mais forte em oito benchmarks retidos envolvendo matemática, ciência, código e raciocínio procedural—nenhum aparecendo em qualquer ambiente de treinamento gerado. O uso de ferramentas mostra ganhos maiores: +5.7 em BFCL-v4 multi-turno e +13.9 em ACEBench-Agent. Uma execução de jogos produziu 4.976 ambientes distintos; a execução de ferramentas de 30B gerou 4.023 ambientes em 105 passos, cada um simulando um backend com um esquema de chamada de função OpenAI. A margem sobre linhas de base de ambiente fixo cresce com a escala do modelo—testado em 4B, 8B e 30B—sugerindo que a abordagem se fortalece conforme o modelo subjacente melhora.

A pilha de treinamento é de peso de produção: RL distribuído via Slime, inferência via SGLang, atualizações de política via Megatron-LM e normalização de vantagem por papel em GRPO. Avaliação usa RLVE, o Berkeley Function Calling Leaderboard e utilitários PRIME. O código é de código aberto em github.com/spade-rl/spade (Python 3.10–3.12, instalável via pip); os lançadores requerem checkpoints convertidos de Megatron, um corpus de fundamentação JSONL e uma chave W&B.

Para equipes construindo sistemas de agentes de longo horizonte no teto de seu pool de tarefas atual, o design de duplo papel com política compartilhada do SPADE é o caminho publicado mais concreto para um currículo auto-expansível. O número +13.9 ACEBench-Agent é o sinal para observar—benchmarks de uso de ferramentas são onde a maioria das falhas de agentes em produção ocorrem, e essa lacuna é grande o suficiente para justificar investimento em infraestrutura em Slime mais Megatron até mesmo antes da abordagem amadurecer.