Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH RiVER Permite Aprendizado por Reforço Sem Rótulos de Verdade Absoluta
RESEARCH A Alucinação de Modelos Mundiais é um Problema de Dados, Não de Arquitetura
RESEARCH Pesquisador Solitário Fica em 2º Lugar no Desafio de Robô Dobrando Roupas da ICRA
RESEARCH Modelos Esquecem Regras Aprendidas Durante o Treinamento
RESEARCH Sinal de Pontuação Gratuito Emerge dos Padrões de Pós-Treinamento RL
RESEARCH Protocolo de Perícia do DeepMind Diagnostica IA Confusa vs. Desalinhada
RESEARCH Modelos Multimodais Trocam Respostas Quando a Ordem de Evidências Muda
RESEARCH IAs de Voz em Produção Ignoram Emoção, Aprovando Fraudes e Encerrando Chamadas de Cuidado
RESEARCH O Modelo 397B do Qwen Simula Ambientes de Agentes Melhor que o GPT-5.4
RESEARCH Benchmark FFASR Expõe Lacuna no Reconhecimento de Fala em Campo Distante RESEARCH Correção de Regex Rigoroso Aumenta Recall de Avaliação de Agentes em 60 Pontos Percentuais
RESEARCH InSight Permite que Robôs Aprendam Autonomamente Novas Tarefas
RESEARCH Dataset OpenThoughts-Agent Atinge 44.8% em Benchmarks de Agentes
RESEARCH Aprendizado em Contexto Amortizado Reduz o Custo de Serviço Few-Shot
RESEARCH DiffusionGemma do Google DeepMind é 28,6X mais difícil de interpretar que modelos autorregressivos
RESEARCH Princeton Lança LOCUS, Corpus de Ordenações Locais dos EUA Legível por Máquina
RESEARCH Três Agentes Vencem Todos os Benchmarks SQL Sem Fine-Tuning
RESEARCH Pipeline LLM OpenAnt Identifica 28 Vulnerabilidades Exploráveis no OpenSSL RESEARCH MIT Extrai Lógica de Atenção em Código Python Intercambiável RESEARCH Redes de Koopman Aumentadas por Física Garantem Generalização em Malhas Irregulares
RESEARCH Um único modelo pode hospedar centenas de personagens de agentes como máscaras leves
RESEARCH Cabeçalhos de Atenção Esparsos Redirecionam Modelos de Visão-Linguagem com 83% de Precisão
RESEARCH ClinHallu Desmembra Por Que LLMs Médicos Erram Imagens 65% do Tempo
RESEARCH Interação de Componentes, Não Qualidade, Determina Desempenho do Agente
RESEARCH A Decodificação Real da DiffusionGemma Contradiz as Afirmativas de Decodificação em Bloco da Google
RESEARCH Relatório da DeepMind Identifica Ganhos de Capacidade 'Desigual' como Risco ASI
RESEARCH Teste Sem Rótulo Captura Falhas de Raciocínio de LLM Melhor do Que Auto-consistência
RESEARCH Agents-K1 Substitui Fatias de Texto RAG por Grafos de Conhecimento Científico Digitados
RESEARCH EvoArena Benchmark Revela Colapso de Agentes em Ambientes em Evolução
RESEARCH Agente Sub-$11 Supera Quadros de Pesquisa Especializados
RESEARCH Agente Recursivo com Aplicação Obtém 89% de Precisão em Tarefas de Código de Longo Contexto
RESEARCH Metade das Correções de Código Geradas por IA Não Passam na Revisão Humana
RESEARCH DIRECT reduz a latência da IA encarnada em 65% com roteamento dinâmico do planejador
RESEARCH Claude Fable 5 Corrigiu Código de Forma Autônoma e Custou US$ 110 em um Dia
RESEARCH Nova Ferramenta Identifica 1.060 Dependências de Treinamento Ocultas em Principais LLMs