A Together AI comparou o DeepSeek V4 Pro 0813 com o GPT-5.6 Sol da OpenAI em DeepSWE, um benchmark de engenharia de software em tipos de tarefas e idiomas. Sol vence single-shot: 72.7% pass@1 vs 62.8% do Pro. Mas em pass@4 (quatro tentativas), Pro se destaca: 88.5% vs 85.8%. A diferença crítica: DeepSeek custa $0.24 por rollout, enquanto Sol custa $8.37 por rollout—uma lacuna de 35x.
Em escala, Pro oferece 260 resoluções de tarefas por $100 gasto versus 9 do Sol. Sol é mais rápido (17 min vs 35 min média, 53 passos vs 146) e mais preciso por tentativa. Pro é confiável a custo menor e vence em tarefas Rust; Sol domina Python/Go. Os modos de falha diferem: Sol quebra suítes de testes existentes em 20% das falhas (assinatura de regressão da família GPT); Pro é mais conservador em 11%.
A estratégia ideal é uma cascata: execute Pro primeiro, escale para Sol em falhas de teste. Esta abordagem híbrida resolve 83% das tarefas DeepSWE a $3.35 por tarefa—10 pontos percentuais acima de Sol-only a 40% do custo unitário do Sol. Para equipes com orçamentos de latência, Sol é premium; para inferência com restrição de custo ou trabalho em lote, Pro-first cascading vira a economia.