DoorDash lançou SafeChat, um sistema de moderação de conteúdo multi-modelo síncrono que analisa cada mensagem de chat, imagem e chamada de voz antes da entrega. A plataforma processa 4 milhões de mensagens de chat, 400.000 chamadas de voz e 200.000 imagens diariamente. A restrição é severa: uma mensagem não pode ser entregue até ser classificada como segura, exigindo conclusão do pipeline em uma fração de segundo, ao invés dos 2–10 segundos que uma chamada raw LLM requer.

A arquitetura repousa em uma observação fundamental: apenas percentuais de um dígito de mensagens são inseguras. Essa distribuição molda toda escolha de custo e latência downstream.

A Fase 1 implementou uma cascata de três camadas. Uma API de moderação gratuita com limiar muito baixo limpou automaticamente 90% das mensagens. O tráfego restante passou para um LLM rápido e de baixo custo com maior precisão, empurrando 99,8% disso para seguro. Os 0,2% restantes foram para um LLM preciso e de custo mais alto que pontuou mensagens de 0–5 em três categorias: profanidade, ameaças e conteúdo sexual. Mensagens pontuando 4 ou superior em pelo menos duas categorias acionaram ações protetoras de Dasher, incluindo cancelamento de entrega.

A Fase 1 acumulou 10 milhões de pontos de dados rotulados. DoorDash treinou um classificador interno nesse corpus—sem custo por chamada, implementado em sua própria infraestrutura. A Fase 2 substituiu as duas primeiras camadas externas por esse modelo. Ele produz safeScore e unsafeScore somando 1. Alto safeScore limpa imediatamente; alto unsafeScore roteia para o LLM preciso. O modelo interno agora trata 99,8% do tráfego de chat em menos de 300 milissegundos. O LLM preciso caro recebe menos de 0,2% das mensagens; mensagens sinalizadas podem levar até 3 segundos, adicionando latência apenas onde uma mensagem é provavelmente insegura.

A moderação de imagem seguiu um caminho diferente. DoorDash testou em shadow uma API externa de visão computacional por duas semanas antes da produção rejeitá-la: taxa de falso positivo muito alta. O time avaliou modelos adicionais de CV e ajustou limites através de revisão humana iterativa. O pipeline de produção agora trata mais de 200.000 imagens diariamente em latência compatível com interações ao vivo.

A moderação de voz é a mais nova e mais difícil. Diferentemente de chat, voz não pode ser bloqueada antes de palavras serem ditas. O pipeline transmite chamadas em tempo real, analisando tom, palavras transcritas e contexto conversacional em múltiplas línguas. DoorDash lançou moderação de voz primeiramente em modo apenas observação—a aplicação automática não ativou até limites de confiança serem validados contra dados observados. Ações disponíveis incluem encerramento de chamada e restrições de comunicação; violações severas ou repetidas escalam para agentes de segurança humanos e acionam suspensão de conta.

A aplicação é graduada por severidade e recorrência através de todos os canais. O time construiu workflows de configuração sem código e um harness de backtesting para que mudanças de política se validem contra tráfego histórico antes de irem ao vivo. Isso importa para organizações precisando que não-engenheiros proprietários de política de moderação sem tocar código de modelo.

SafeChat cortou incidentes de segurança de baixa e média severidade em 50% desde a implementação.

Para arquitetos construindo qualquer pipeline de decisão de IA em tempo real: meça a distribuição real primeiro, então construa um gate barato agressivo para a maioria fácil. Use tráfego de produção para rotular dados para um modelo interno sem custo. Reserve o modelo frontier caro para casos duros irredutíveis. Essa matemática de cascata reduz chamadas de inferência caras em 99,8% sem compromisso para recall.