Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH Ataques Soft-Prefix Invertem o Raciocínio dos LLMs em 90% com Injeção de Vetor Oculto
RESEARCH Tokens de Patch Denso Combatem Modelos de Visão-Linguagem com 1% dos Parâmetros
RESEARCH SWE-Pruner Pro Reduz o Uso de Tokens de Agente de Codificação em 39%
RESEARCH OpenAI Suspende Modelo Após Escapar da Caixa de Areia e Contornar a Segurança
RESEARCH Quadro de Agente Android Reduz Tempo de Tarefa Móvel em 95%
RESEARCH Método E3 Reduz o Uso de Tokens de Agente LLM em 91% nas Edições de Código
RESEARCH TerraZero Supera o Benchmark InterPlan Sem Dados Humanos
RESEARCH Julgadores de LLM Invertem 85% das Sentenças com Respostas de Referência
RESEARCH Três Horas em uma GPU de US$ 329 Substitui Milhares de Horas de Treinamento NAS
RESEARCH Apple's MM-ToolSandBox Revela Por Que Metade dos Agentes IA na Fronteira Falha em Tarefas Visuais
RESEARCH Correções ao Nível de Ativação Superam Edições de Prompts para Julgadores de LLMs com Vies
RESEARCH ZoRRO Combina CTR de Aprendizado Profundo com Velocidade 600×
RESEARCH Treinamento de Pesos Super falha em modelos OLMo, demolindo a estratégia de afinação esparsa
RESEARCH Compressão de Baixa Rank com Eficiência de Treinamento Desvia da Prova de Velocidade de Serviço
RESEARCH Hugging Face Reduz Sobrecarga de Atenção na Inferência em 20-40% com Núcleos Fundidos
RESEARCH Claude Opus Não Consegue Metade das Tarefas do Mundo Real no UniClawBench
RESEARCH Co-LMLM da Cornell empata GPT-4o-Mini armazenando fatos em um banco de dados RESEARCH Ponderação de Timestep Reduz Custos de Consulta ao Modelo de Recompensa para RLHF de Difusão
RESEARCH STRACE Framework Aumenta Verificação Multi-Agente em 16 Pontos
RESEARCH DynaKRAG Aumenta Precisão em QA Multi-Hop até 5,78 Pontos
RESEARCH OpenAI Revela que 30% das Tarefas do SWE-Bench Pro Estão Quebradas
RESEARCH DepthWeave-KV reduz memória de cache de LLM em 8,3x sem retreinamento
RESEARCH SovereignPA-Bench Mede se Agentes de IA Protegem Limites do Usuário
RESEARCH Loop Duplo de Planejamento Resolve Fossa Semântica em Robôs Hierárquicos
RESEARCH SearchGen-20K Ensina Geradores Visuais Quando Pesquisar
RESEARCH CompactionRL impulsiona agentes de codificação GLM em 5–7 pontos nos benchmarks
RESEARCH Novo Método de Verificação Atinge 86,5% em Terminal-Bench Sem Ajuste Fino
RESEARCH Monitor de Limite Simples Iguala Salvaguardas Complexas de LLMs em Artigo do ICML
RESEARCH Agentes de Código Desalinhados Evitam Monitores em 93% dos Ataques Graduais
RESEARCH LACUNA Demonstra que Métodos de Desaprendizado Falham em Apagar PII de Modelos
RESEARCH Rótulos em Linguagem Natural Superam Escalares no Aprendizado Offline de Robôs
RESEARCH Theoria conecta prova formal e juízes LLM com verificação auditável
RESEARCH Três grandes benchmarks inflacionam escores de agentes de código, auditoria descobre
RESEARCH Treinamento do AutoMem Duplica Desempenho de Agentes em Tarefas de Longo Horizonte
RESEARCH Uma Camada Equivale ao Treinamento Completo com RL em Modelos Qwen