A confiabilidade dos agentes de produção migrou do modelo para o harness que o cerca.
Noventa e três vírgula seis por cento. É a taxa de invocação da ferramenta maliciosa que um ataque batizado A2M alcança no GLM-4.6, envenenando só o metadado de uma ferramenta — sem tocar no modelo. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]
E é assim que agente MCP decide qual ferramenta invocar — por correspondência semântica com a tarefa, não por peso de modelo. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]
Este é o ai|expert Wire. A confiabilidade dos agentes de produção migrou do modelo pro harness que o cerca.
Três histórias esta semana apontam pro mesmo lugar. Um bug de imagem encadeado a uma falha de SSO deu acesso a contas de funcionário e a repositório interno da OpenAI. Um ataque batizado A2M sequestra agente MCP sem tocar em peso nenhum de rede neural. E o próprio framework de confiabilidade da OpenAI admite que essas falhas moram na camada de harness, não no modelo.
Comece pela cadeia da OpenAI. Um heap overflow numa biblioteca de imagem, a libheif, dentro do fórum da Discourse — a validação padrão não suporta HEIF, então o upload ia direto pro ImageMagick, e a versão vulnerável não tinha CVE nem backport. Cadeia completa até acesso a repositório interno: menos de 72 horas. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]
E o pulo pra dentro veio do SSO — "Sign in with OpenAI" deu aos pesquisadores acesso à conta de Codex de um funcionário, conectada ao GitHub da organização. Não foi bug de modelo em nenhum momento da cadeia. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]
A campanha mais ampla, batizada HEIF Heist, rastreou a mesma falha de libheif em Slack, Meta, GitHub Enterprise e frameworks como Next.js, Astro e Gatsby — dois meses de trabalho, menos de três mil dólares em token. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]
OpenAI pagou seis mil e quinhentos dólares de bounty. É pouco pra escala do que ficou exposto. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]
Agora o A2M. É ataque de metadado, não de peso: o atacante otimiza a descrição da ferramenta pra parecer semanticamente relevante, o agente decide invocar por correspondência semântica, e a partir daí o atacante refina o retorno usando o próprio rastro de execução do agente — caixa-preta, sem acesso a peso nenhum. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]
A taxa média de sucesso do ataque, contando exfiltração de informação, comprometimento de ambiente e desvio de raciocínio, foi de setenta e quatro vírgula quatro por cento. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]
E tem um efeito colateral que ninguém mede no orçamento: o custo em token sobe trinta e duas vírgula quatro vezes a linha de base benigna quando o ataque força o agente a invocar ferramenta cara repetidamente. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]
É o mesmo diagnóstico que Vinoth Govindarajan, da OpenAI, deu em setembro: confiabilidade de agente em produção não é pergunta sobre o modelo. Govindarajan resume o contrato de produção assim — o modelo propõe, o harness grava, e o recibo prova. Cinco padrões substituem qualidade de modelo como medida de prontidão: dono do estado, serialização de escrita, escopo de execução, limite de tempo de trabalho, validação na borda. [ref: the-agent-harness-control-planes-invariants-and-approval-boundaries-for-producti]
O caso que ele abre é pior que um crash. O agente confirma que vai lembrar de um reembolso, o usuário não vê erro nenhum, e por trás a escrita nunca persiste na sessão. Sucesso silencioso é uma mentira — um crash pelo menos te dá uma borda. [ref: the-agent-harness-control-planes-invariants-and-approval-boundaries-for-producti]
Se a falha mora no harness, a pergunta que sobra é qual harness — e quanto ele custa.
Troca de harness sozinha já explica cinco vezes de diferença de custo, com taxa de sucesso quase idêntica. Um estudo da UC Berkeley e da Arena Intelligence rodou vinte e um pares modelo-harness em sete modelos e três harnesses. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]
Claude Fable 5 resolve noventa e sete vírgula oito por cento das tentativas no Claude Code, noventa e seis vírgula sete no Codex, noventa e seis vírgula sete no Pi — e o Claude Code custa o dobro do Pi pelo mesmo resultado. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]
E o Pi chega nesse teto de desempenho oferecendo só quatro ferramentas: ler, escrever, editar, bash. Contexto inicial mais de dez vezes menor que o do Claude Code. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]
GPT-5.6 Sol, que a própria OpenAI descreve como otimizado pra engenharia de software agente no Codex, teve sucesso maior no Pi — oitenta e três vírgula três por cento contra setenta e oito vírgula nove no Codex — e a cerca de metade do custo. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]
Só que harness enxuto não fecha o buraco inteiro. Um terço dos patches que passam em todo teste local falham quando você valida de ponta a ponta contra o serving real de produção. [ref: swe-serve-benchmarking-agentic-engineering-for-production-inference-serving]
E o gap não é uniforme. Tarefas que cruzam múltiplos domínios de runtime caem vinte e um vírgula três pontos percentuais de taxa de sucesso comparado a tarefas de domínio único — e isso persiste mesmo no esforço máximo de raciocínio. [ref: swe-serve-benchmarking-agentic-engineering-for-production-inference-serving]
No benchmark, Opus 5 e Sol empatam em setenta e cinco por cento de pass@1, mas Opus custa dezessete dólares e quarenta por tarefa no esforço máximo, contra doze vinte e seis do Sol. [ref: swe-serve-benchmarking-agentic-engineering-for-production-inference-serving]
É exatamente esse buraco que o Cloudflare Worker Previews tenta fechar. Cada branch ganha ambiente isolado, com namespace próprio de Durable Objects e de Container, pra testar mudança de infraestrutura de agente sem tocar tráfego real. [ref: cloudflare-worker-previews-isolated-environments-for-agent-changes]
A Ramp já usa Previews pra revisar pull request gerado por agente antes de mesclar; a Supermemory testa rota com Durable Object antes de subir pra produção. [ref: cloudflare-worker-previews-isolated-environments-for-agent-changes]
Isolamento por branch resolve migração e schema. Não resolve tudo: binding de serviço de dentro de um Preview ainda chama a versão de produção do outro lado, e fila e Workflow ainda não rodam isolados. [ref: cloudflare-worker-previews-isolated-environments-for-agent-changes]
Quando o modelo vira commodity, a disputa se muda pra camada que quase ninguém audita: o harness que decide o que o agente pode fazer. Na Edition de sexta, o balanço completo da semana em custo e infraestrutura de agentes em produção. Boa semana.