NVIDIA lançou em 11 de agosto o Nemotron 3.5 Lightning, um modelo open-source de 30 bilhões de parâmetros com arquitetura mixture-of-experts projetado para cargas de trabalho de IA agêntica. O modelo oferece velocidade de saída até 4x mais rápida e permite conclusão de tarefas agênticas 30% mais rápida em comparação com outros modelos da mesma classe, segundo benchmarks PinchBench da NVIDIA. Lightning é totalmente personalizável e funciona em hardware local, incluindo PCs RTX, workstations DGX e dispositivos edge Jetson, dando às empresas controle sobre privacidade de dados e implantação.
Ao lado do Lightning, NVIDIA lançou NeMo Switchyard, uma biblioteca de roteamento open-source que direciona inteligentemente as requisições para o modelo mais capaz de cada tarefa, reduzindo custos de inferência para aproximadamente um terço do Claude Opus 4.8 sozinho mantendo acurácia de nível frontier. Parceiros empresariais, incluindo CrowdStrike, Harvey e CodeRabbit, já estão personalizando o Lightning para tarefas específicas de domínio.
O movimento de NVIDIA se alinha com a declaração de julho do CEO Jensen Huang de que a IA open-source gratuita é boa para vendas de chips, posicionando Nemotron contra competidores chineses como DeepSeek V3 e Alibaba Qwen3.5. O modelo está disponível no Hugging Face e via microserviços NVIDIA NIM, com dados de treinamento e receitas publicados abertamente para transparência e reprodutibilidade. Arquitetos implantando fluxos de trabalho agênticos se beneficiam da eficiência de custos e flexibilidade de implantação local, particularmente para sistemas multi-modelo exigindo latência sub-segundo.