Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH
RESEARCH
RESEARCH Classificação Jev em 25 linhas de Python com inferência local
RESEARCH Claude Opus 5 lidera benchmark de design de circuitos com 61.6%, mas falha em 4 de 10 RESEARCH SWE-2 da Cognition iguala desempenho de código frontier com 64% menos custo
RESEARCH Knowledge Pull Requests alcançam 69% de acurácia em QA versus 48% para reescritas brutas
RESEARCH GravityOCR alcança 3.94× de aceleração em OCR de documentos via decodificação especulativa
RESEARCH Os traces de raciocínio comprimido do GPT-6 Astra não se transferem para modelos mais fracos
RESEARCH Agensh da Microsoft atinge 55% de taxa de aprovação com 1.024 agentes
RESEARCH SWE-Serve revela 23-point gap entre testes locais e serving em produção
RESEARCH Ataque A2M sequestra agentes MCP com metadados de ferramentas envenenadas a 93.6%
RESEARCH Escolha de harness gera diferença de custo de 5x enquanto taxas de sucesso de agentes de código permanecem planas
RESEARCH Flash-dLLM cuts diffusion LLM inference latency 11× with fused kernels
RESEARCH Seis Modelos de ASR Memorizam Benchmarks em Vez de Transcrever
RESEARCH Paper do Google DeepMind mostra quando sinais de roteamento desperdiçam processamento
RESEARCH O 20B-Token Corpus do MidTool Eleva o Desempenho do Tool-Use nos Benchmarks
RESEARCH VLA Detecta Coordenação Oculta de Agentes em Acurácia de 0.993
RESEARCH Agentes SPADE Aprendem Ensinando a Si Mesmos Novas Tarefas
RESEARCH DSpark da Liquid AI atinge aceleração de 3.18x em H100 com decodificação especulativa
RESEARCH Novo Método Prova Caminho de Raciocínio do Modelo em 128 Casos de Teste, Falha em Modelos Padrão
RESEARCH Estudo da IBM: Memória Curada Impulsiona Agentes de Médio Porte em 16 Pontos RESEARCH METR Descobre que IA Acelera Vulnerabilidades Mas Não Otimização
RESEARCH BATON reduz o custo de exploração de tarefas de robôs de exponencial para linear
RESEARCH OpenAI e NVIDIA Garantem Fábrica de IA de 8 Gigawatts no Campus de Ohio
RESEARCH Correção de Alocação de Memória Permite que Modelos Recorrentes Correspondam à Atenção em Escala
RESEARCH Pesquisadores Expõem Hipnose de Modelo: Dicas de Prompt Invisíveis Sequestram IA com 99% de Sucesso
RESEARCH Detectores de Conformidade Falham no Teste de Cegueira de Regras, Auditoria Lexsi Constata
RESEARCH KV-Rescue Recupera 87% da Precisão Perdida do Modelo
RESEARCH QuoteBench Expõe Brecha de 55 Pontos Escondida em Benchmarks de Agentes de Código
RESEARCH Google DeepMind lança IA de linguagem de sinais no Pixel 11 RESEARCH Agentes Resolvem Apenas 27 de 43 Tarefas de Código Verificado
RESEARCH Agentes LLM Caem para Supply-Chain Attacks Escondidos em Linguagem Simples
RESEARCH Andaimes no Tempo de Inferência Elevam Acurácia de Modelos Fracos a 0.91
RESEARCH O Benchmark VAKRA da IBM Mostra que Modelos Falham em 97% das Tarefas com Restrições de Política RESEARCH O Framework RCI Reduz Violações de Restrições no Treinamento de RL Offline Seguro
RESEARCH Liquid AI lança modelo de visão de borda com 3.1B parâmetros e 228 tokens/segundo