Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH
RESEARCH
RESEARCH Agentes LLM Caem para Supply-Chain Attacks Escondidos em Linguagem Simples
RESEARCH Andaimes no Tempo de Inferência Elevam Acurácia de Modelos Fracos a 0.91
RESEARCH O Benchmark VAKRA da IBM Mostra que Modelos Falham em 97% das Tarefas com Restrições de Política RESEARCH O Framework RCI Reduz Violações de Restrições no Treinamento de RL Offline Seguro
RESEARCH Liquid AI lança modelo de visão de borda com 3.1B parâmetros e 228 tokens/segundo
RESEARCH Embeddings Geoespaciais Abertos Reduzem Barreiras para Análise de Dados de Satélite
RESEARCH Sistema de IA Reduz Limites de Problema Matemático de 40 Anos
RESEARCH Treinamento Unificado de LLM Revela Conflito Fundamental de Modos
RESEARCH MMDiff Permite que Engenheiros Auditem e Editem Características de Modelos Multimodais
RESEARCH ArchAgent v2 supera campeões humanos no design de cache de três níveis RESEARCH GENCO substitui três solucionadores clássicos de rede elétrica por uma arquitetura neural
RESEARCH Consilience da Amazon Detecta Colapso de Modo Silencioso no Raciocínio Baseado em Confiança
RESEARCH Taboo Realiza Testes de Estresse de LLMs em Restrições de Produção
RESEARCH Colapso do Otimizador Muon Após Grokking Ameaça Treinamento em Produção
RESEARCH Benchmark SABRE Expõe a Cegueira de Modelos de Visão para Contradições Visuais
RESEARCH CreativeInstruct Recupera Diversidade Sem Desacelerar a Inferência
RESEARCH Mankind Labs Reduz Tokens de Loop Agentic em 17–26% Com Evicção Reversível de Memória RESEARCH CoinRAG Alcança Ganho de 5,3% F1 em RAG Multi-Salto com Cache de Nuggets de Informação
RESEARCH CalibForge Treina Modelos com Ganhos de 30 Pontos Usando Tarefas Calibradas por Solver
RESEARCH AV-AIVAT Reduz Custo de Avaliação de Agentes em 74 Vezes com Parada Certificada RESEARCH Programação de Chamadas de Ferramentas Supera JSON em Novos Modelos de IA RESEARCH NVIDIA Publica Guia Completo de RAG para Grego Alcançando Ganho de Recuperação 2.3×
RESEARCH Os Ciclones WeatherNext da DeepMind Superam Modelos de Furacões por um Dia Inteiro
RESEARCH Skill Entropy Eleva Pontuações de Modelos de Raciocínio de 34% a 68%
RESEARCH OctoLong melhora agentes de código com treinamento entre repositórios
RESEARCH EvolveNet Evolui Harness de Agentes em Vez de Pesos do Modelo
RESEARCH Chain-of-Thought Funciona em Escala Tiny, Quebrando o Vínculo Computacional RESEARCH SeGaBench Testa LLMs em Otimização de Código Cego para Compiladores
RESEARCH ReflectRL Recupera Ganhos de Raciocínio de Rollouts Falhados de Especialista
RESEARCH Regimes de scaling em tempo de inferência exigem perfis de avaliação distintos RESEARCH Modelos ALiBi Perdem Conhecimento Posicional em Inferência de Contexto Longo
RESEARCH Entradas de Lançamento Importam Mais do Que a Escolha do Modelo para Testes de TUI