Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH Agents-K1 Substitui Fatias de Texto RAG por Grafos de Conhecimento Científico Digitados
RESEARCH EvoArena Benchmark Revela Colapso de Agentes em Ambientes em Evolução
RESEARCH Agente Sub-$11 Supera Quadros de Pesquisa Especializados
RESEARCH Agente Recursivo com Aplicação Obtém 89% de Precisão em Tarefas de Código de Longo Contexto
RESEARCH Metade das Correções de Código Geradas por IA Não Passam na Revisão Humana
RESEARCH DIRECT reduz a latência da IA encarnada em 65% com roteamento dinâmico do planejador
RESEARCH Claude Fable 5 Corrigiu Código de Forma Autônoma e Custou US$ 110 em um Dia
RESEARCH Nova Ferramenta Identifica 1.060 Dependências de Treinamento Ocultas em Principais LLMs
RESEARCH Ramificação em Nível de Token Oferece Treinamento Mais Rápido para Agente de LLM Sem Expansão de Orçamento
RESEARCH Recuperação de Token Fecha a Fossa de Precisão e Diminui a Computação de Inferência de VLM pela Metade
RESEARCH Sistema Tahoe Text-to-SQL Reduz Retroalimentação do Compilador em 96%
RESEARCH Google's DiffusionGemma Atinge 1.000 Tokens por Segundo
RESEARCH GRPO Reduz Erros de Tratamento de Pausas em Agentes Full-Duplex Sem Perda Semântica
RESEARCH Diagrama de Fases de Kamai Prevê Falhas Multimodais Antes do Investimento em GPU
RESEARCH ABC-Bench Mostra que Agentes de LLM Agora Superam Biólogos Especiais em Tarefas de Laboratório
RESEARCH FPCG dirige modelos de raciocínio em tempo de teste sem retreinamento
RESEARCH Sondas Lineares Atingem 64-91% de Precisão para Modelos de Raciocínio Direcionados RESEARCH Quadros de Liderança de LLM Não Prevêem Confiabilidade em Produção
RESEARCH Grok 3 Supera Biologistas Credenciados em Tarefas de Laboratório Automático de DNA
RESEARCH EEVEE Vence Agentes de Auto-Melhoria com Margem de 48% em Inferência Multi-Domínio
RESEARCH Compilador Piper Elimina a Codificação Manual para Treinamento Distribuído
RESEARCH Camada Linear Única Supera Porta de 1M-Parâmetros no Teste de Aceleração de MTP
RESEARCH Real EHR Benchmark Exposta Limites dos LLMs em Ações Clínicas
RESEARCH AHA-WAM alcança controle de robô 4.59 vezes mais rápido desacoplando Transformadores de Difusão
RESEARCH FASE Reduz Detecção de Alucinações para 333x Velocidade
RESEARCH Novo Método DRPO Corrige Colapso de Vocabulário de Longo-Cabeça em RL de LLM
RESEARCH FASE Reduz Custo de Detecção de Alucinações para 0,3% dos Concorrentes
RESEARCH SIGA Acelera Agentes de Codificação em Simuladores Científicos por 36×
RESEARCH Echo-Memory Mostra que Modelos de Mundo Falham no Teste de Revisão
RESEARCH Pesquisadores de Waterloo reduzem custo de quantificação de incerteza em 99,7% com FASE
RESEARCH Esquema EvalCards Expõe Falhas Sistematizadas em Metadados de Benchmarks de IA
RESEARCH Perplexidade IA Agênica Reduz Tempo de Tarefa 87% em Estudo de Produção
RESEARCH 64 Por cento dos Conflitos de Áudio-Texto nos Modelos de IA São Corrigíveis
RESEARCH Router Correspondência de 50 Novas Tentativas com 10 Amostras Corta Computação de Teste de LLM
RESEARCH StreamMA Reduz Latência de Raciocínio Multi-Agente em 26,9×
RESEARCH Painéis de Julgamento Diversificados por Fornecedor Eliminam Vies em Avaliações de Modelos de Linguagem