aiexpert
Inicio / Podcast / Ep. 35
35
Episodio 35 · 7 min · Boletín

A confiabilidade dos agentes de produção migrou do modelo para o harness que o cerca.

A confiabilidade dos agentes de produção migrou do modelo para o harness que o cerca.

Presentan AlanPresentación
RSS

Transcripción del episodio

El guion que salió al aire, íntegro
Alan

Noventa e três vírgula seis por cento. É a taxa de invocação da ferramenta maliciosa que um ataque batizado A2M alcança no GLM-4.6, envenenando só o metadado de uma ferramenta — sem tocar no modelo. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]

Ada

E é assim que agente MCP decide qual ferramenta invocar — por correspondência semântica com a tarefa, não por peso de modelo. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]

Alan

Este é o ai|expert Wire. A confiabilidade dos agentes de produção migrou do modelo pro harness que o cerca.

Alan

Três histórias esta semana apontam pro mesmo lugar. Um bug de imagem encadeado a uma falha de SSO deu acesso a contas de funcionário e a repositório interno da OpenAI. Um ataque batizado A2M sequestra agente MCP sem tocar em peso nenhum de rede neural. E o próprio framework de confiabilidade da OpenAI admite que essas falhas moram na camada de harness, não no modelo.

Ada

Comece pela cadeia da OpenAI. Um heap overflow numa biblioteca de imagem, a libheif, dentro do fórum da Discourse — a validação padrão não suporta HEIF, então o upload ia direto pro ImageMagick, e a versão vulnerável não tinha CVE nem backport. Cadeia completa até acesso a repositório interno: menos de 72 horas. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]

Alan

E o pulo pra dentro veio do SSO — "Sign in with OpenAI" deu aos pesquisadores acesso à conta de Codex de um funcionário, conectada ao GitHub da organização. Não foi bug de modelo em nenhum momento da cadeia. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]

Ada

A campanha mais ampla, batizada HEIF Heist, rastreou a mesma falha de libheif em Slack, Meta, GitHub Enterprise e frameworks como Next.js, Astro e Gatsby — dois meses de trabalho, menos de três mil dólares em token. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]

Alan

OpenAI pagou seis mil e quinhentos dólares de bounty. É pouco pra escala do que ficou exposto. [ref: heap-overflow-and-sso-misconfiguration-compromised-openai-internal-repos]

Ada

Agora o A2M. É ataque de metadado, não de peso: o atacante otimiza a descrição da ferramenta pra parecer semanticamente relevante, o agente decide invocar por correspondência semântica, e a partir daí o atacante refina o retorno usando o próprio rastro de execução do agente — caixa-preta, sem acesso a peso nenhum. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]

Alan

A taxa média de sucesso do ataque, contando exfiltração de informação, comprometimento de ambiente e desvio de raciocínio, foi de setenta e quatro vírgula quatro por cento. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]

Ada

E tem um efeito colateral que ninguém mede no orçamento: o custo em token sobe trinta e duas vírgula quatro vezes a linha de base benigna quando o ataque força o agente a invocar ferramenta cara repetidamente. [ref: a2m-trace-optimized-agent-hijacking-in-the-mcp-ecosystem]

Alan

É o mesmo diagnóstico que Vinoth Govindarajan, da OpenAI, deu em setembro: confiabilidade de agente em produção não é pergunta sobre o modelo. Govindarajan resume o contrato de produção assim — o modelo propõe, o harness grava, e o recibo prova. Cinco padrões substituem qualidade de modelo como medida de prontidão: dono do estado, serialização de escrita, escopo de execução, limite de tempo de trabalho, validação na borda. [ref: the-agent-harness-control-planes-invariants-and-approval-boundaries-for-producti]

Ada

O caso que ele abre é pior que um crash. O agente confirma que vai lembrar de um reembolso, o usuário não vê erro nenhum, e por trás a escrita nunca persiste na sessão. Sucesso silencioso é uma mentira — um crash pelo menos te dá uma borda. [ref: the-agent-harness-control-planes-invariants-and-approval-boundaries-for-producti]

Alan

Se a falha mora no harness, a pergunta que sobra é qual harness — e quanto ele custa.

Ada

Troca de harness sozinha já explica cinco vezes de diferença de custo, com taxa de sucesso quase idêntica. Um estudo da UC Berkeley e da Arena Intelligence rodou vinte e um pares modelo-harness em sete modelos e três harnesses. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]

Claude Fable 5 resolve noventa e sete vírgula oito por cento das tentativas no Claude Code, noventa e seis vírgula sete no Codex, noventa e seis vírgula sete no Pi — e o Claude Code custa o dobro do Pi pelo mesmo resultado. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]

Alan

E o Pi chega nesse teto de desempenho oferecendo só quatro ferramentas: ler, escrever, editar, bash. Contexto inicial mais de dez vezes menor que o do Claude Code. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]

Ada

GPT-5.6 Sol, que a própria OpenAI descreve como otimizado pra engenharia de software agente no Codex, teve sucesso maior no Pi — oitenta e três vírgula três por cento contra setenta e oito vírgula nove no Codex — e a cerca de metade do custo. [ref: harnesstax-how-much-does-the-harness-matter-for-coding-agents]

Alan

Só que harness enxuto não fecha o buraco inteiro. Um terço dos patches que passam em todo teste local falham quando você valida de ponta a ponta contra o serving real de produção. [ref: swe-serve-benchmarking-agentic-engineering-for-production-inference-serving]

Ada

E o gap não é uniforme. Tarefas que cruzam múltiplos domínios de runtime caem vinte e um vírgula três pontos percentuais de taxa de sucesso comparado a tarefas de domínio único — e isso persiste mesmo no esforço máximo de raciocínio. [ref: swe-serve-benchmarking-agentic-engineering-for-production-inference-serving]

Alan

No benchmark, Opus 5 e Sol empatam em setenta e cinco por cento de pass@1, mas Opus custa dezessete dólares e quarenta por tarefa no esforço máximo, contra doze vinte e seis do Sol. [ref: swe-serve-benchmarking-agentic-engineering-for-production-inference-serving]

Ada

É exatamente esse buraco que o Cloudflare Worker Previews tenta fechar. Cada branch ganha ambiente isolado, com namespace próprio de Durable Objects e de Container, pra testar mudança de infraestrutura de agente sem tocar tráfego real. [ref: cloudflare-worker-previews-isolated-environments-for-agent-changes]

Alan

A Ramp já usa Previews pra revisar pull request gerado por agente antes de mesclar; a Supermemory testa rota com Durable Object antes de subir pra produção. [ref: cloudflare-worker-previews-isolated-environments-for-agent-changes]

Ada

Isolamento por branch resolve migração e schema. Não resolve tudo: binding de serviço de dentro de um Preview ainda chama a versão de produção do outro lado, e fila e Workflow ainda não rodam isolados. [ref: cloudflare-worker-previews-isolated-environments-for-agent-changes]

Alan

Quando o modelo vira commodity, a disputa se muda pra camada que quase ninguém audita: o harness que decide o que o agente pode fazer. Na Edition de sexta, o balanço completo da semana em custo e infraestrutura de agentes em produção. Boa semana.