A Stampli comprimiu 243 horas de trabalho de lançamento em 77 horas—uma redução de 68%—ao entregar Deep Finance usando Codex e ChatGPT Work do OpenAI. O OpenAI publicou os dados em 20 de agosto de 2026. É um dos benchmarks de produtividade mais granulares disponíveis para entrega de software e conteúdo assistida por IA.
Deep Finance é uma camada de inteligência de gastos para CFOs e VPs na plataforma procure-to-pay da Stampli. O lançamento exigiu sete tipos de entregáveis em paralelo: série de blog, emails de lançamento, webinar e apresentação, criativo social e pago, release PR Newswire, página da web e habilitação de vendas. Os recursos de design e contratados externos não estavam disponíveis—a equipe de marketing executou com o que tinha.
A equipe construiu um sistema de conhecimento compartilhado no Codex em vez de abordar tarefas sequencialmente. O Codex ingeriu contexto de produto, notas de reunião, tickets Jira, histórico GitHub e diretrizes de mensagens, depois produziu rascunhos prontos para revisão em todos os tipos de entregáveis. Cada ativo voltado para o cliente recebeu revisão humana. O Codex cuidou de 90% da animação do herói antes que um contratado terminasse a cena de abertura. A estimativa de 243 horas é o que essas tarefas custariam sem o Codex; 77 horas é o que realmente levou.
A mesma infraestrutura agora executa o trabalho diário. Antes, manter os materiais atualizados significava entrevistar PMs, ler Jira, revisar GitHub e construir manualmente artigos da central de ajuda, one-pagers e apresentações. A Stampli agora usa agentes conectados à sua fonte de verdade para extrair de sistemas de produto e notas de reunião. A Diretora de Marketing de Produtos Melad Zahedi disse que o sistema multiplicou a saída por 10×, de alguns conteúdos por semana para centenas.
As consultas dinâmicas revelaram demandas de confiabilidade mais altas. Durante uma reunião executiva, um funcionário usou o Codex para extrair e analisar métricas HubSpot em segundos. Zahedi disse que a alternativa era meio dia de trabalho de FP&A. O tempo real: 20 segundos de digitação. Isso não é um benchmark controlado—é um evento em reunião, o que significa que a barra de latência e confiabilidade era mais alta que um fluxo de trabalho assíncrono típico.
O caso de estudo omite overhead de engenharia de prompt, taxas de erro antes da revisão humana e como a equipe lida com desvio de versão quando Jira ou GitHub atualiza mais rápido que a janela de contexto do Codex. Equipes replicando isso enfrentarão esses custos. A figura de 68% é saída líquida, não esforço de configuração ou manutenção.
Para equipes avaliando velocidade assistida por IA, os números da Stampli funcionam como um teto, não uma mediana. As condições eram favoráveis: uma pequena equipe de marketing tecnicamente disposta, escopo fixo e forte acesso ao contexto de produtos. Se sua equipe está se afogando em reconstrução de contexto antes da execução, uma camada de ingestão com tecnologia GPT vale a pena modelar. A Stampli oferece um número específico para você usar.