Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH Treinamento Unificado de LLM Revela Conflito Fundamental de Modos
RESEARCH MMDiff Permite que Engenheiros Auditem e Editem Características de Modelos Multimodais
RESEARCH ArchAgent v2 supera campeões humanos no design de cache de três níveis RESEARCH GENCO substitui três solucionadores clássicos de rede elétrica por uma arquitetura neural
RESEARCH Consilience da Amazon Detecta Colapso de Modo Silencioso no Raciocínio Baseado em Confiança
RESEARCH Taboo Realiza Testes de Estresse de LLMs em Restrições de Produção
RESEARCH Colapso do Otimizador Muon Após Grokking Ameaça Treinamento em Produção
RESEARCH Benchmark SABRE Expõe a Cegueira de Modelos de Visão para Contradições Visuais
RESEARCH CreativeInstruct Recupera Diversidade Sem Desacelerar a Inferência
RESEARCH Mankind Labs Reduz Tokens de Loop Agentic em 17–26% Com Evicção Reversível de Memória RESEARCH CoinRAG Alcança Ganho de 5,3% F1 em RAG Multi-Salto com Cache de Nuggets de Informação
RESEARCH CalibForge Treina Modelos com Ganhos de 30 Pontos Usando Tarefas Calibradas por Solver
RESEARCH AV-AIVAT Reduz Custo de Avaliação de Agentes em 74 Vezes com Parada Certificada RESEARCH Programação de Chamadas de Ferramentas Supera JSON em Novos Modelos de IA RESEARCH NVIDIA Publica Guia Completo de RAG para Grego Alcançando Ganho de Recuperação 2.3×
RESEARCH Os Ciclones WeatherNext da DeepMind Superam Modelos de Furacões por um Dia Inteiro
RESEARCH Skill Entropy Eleva Pontuações de Modelos de Raciocínio de 34% a 68%
RESEARCH OctoLong melhora agentes de código com treinamento entre repositórios
RESEARCH EvolveNet Evolui Harness de Agentes em Vez de Pesos do Modelo
RESEARCH Chain-of-Thought Funciona em Escala Tiny, Quebrando o Vínculo Computacional RESEARCH SeGaBench Testa LLMs em Otimização de Código Cego para Compiladores
RESEARCH ReflectRL Recupera Ganhos de Raciocínio de Rollouts Falhados de Especialista
RESEARCH Regimes de scaling em tempo de inferência exigem perfis de avaliação distintos RESEARCH Modelos ALiBi Perdem Conhecimento Posicional em Inferência de Contexto Longo
RESEARCH Entradas de Lançamento Importam Mais do Que a Escolha do Modelo para Testes de TUI
RESEARCH Microsoft Mapeia Falhas de Planejamento em Agentes Multilingues, Eleva Precisão em 5.6%
RESEARCH Benchmark GDPevo mostra que agentes empresariais ganham 8 pontos com experiência
RESEARCH HazMart Quantifica o Dilema Fidelidade-Segurança em Modelos de Raciocínio
RESEARCH Modelos de Fronteira Tentam Enganar em 7–14% das Rodadas de Avaliação
RESEARCH AtumAI Reduz Design de Política de Datacenter de Meses para Texto Simples
RESEARCH PRECOG Reduz Latência de RAG 4500× em Hardware SSM de Borda
RESEARCH Robô Caltech Desvia de Bolas com Precisão de 95% Usando Apenas uma Câmera
RESEARCH Smevals reduz custo de avaliação de modelos desacoplando pontuação de execução de testes RESEARCH Equipe de Maryland ajusta a constante oculta da OPSD para corrigir fragilidade
RESEARCH Amostragem Repetida Supera a Auto-Reflexão em Modelos de IA Pequenos