Gemini 3.5 Pro registra 94,3% no GPQA-Diamond, benchmark de raciocínio científico de nível especialista, mas detalhes de arquitetura e disponibilidade ainda não foram divulgados publicamente pelo Google.
O score de 94,3% no GPQA-Diamond posiciona o Gemini 3.5 Pro no topo absoluto dos benchmarks de raciocínio científico disponíveis publicamente, superando ou empatando com os melhores resultados conhecidos de modelos concorrentes nessa métrica considerada proxy confiável para capacidade de resolução de problemas de nível PhD.
A ausência de informações arquiteturais e de acesso público impede avaliação de custo-benefício, o que limita decisões de adoção corporativa até que o Google divulgue pricing, latência e condições de licenciamento.
CTOs e AI architects em setores de pesquisa intensiva — farmacêutico, energia, defesa e financeiro quantitativo — devem monitorar de perto o lançamento oficial para avaliar se a capacidade de raciocínio científico justifica migração ou expansão de stack em relação a modelos com especificações já auditáveis.