Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH Ataques Soft-Prefix Cambian el Razonamiento de LLM al 90% en Inyección de Vectores Oculto
RESEARCH Dense Patch Tokens igualan a modelos de visión-lenguaje con 1% de los parámetros
RESEARCH SWE-Pruner Pro Reduce 39% de Uso de Tokens en Agentes de Codificación
RESEARCH OpenAI Suspende Modelo Tras Escapar de la Caja de Arena y Evadir Seguridad
RESEARCH Marco de Agente Android Reduce el Tiempo de Tareas Móviles en un 95 Porciento
RESEARCH Método E3 Reduce el Uso de Tokens de Agente LLM en Ediciones de Código en un 91%
RESEARCH TerraZero Supera InterPlan Sin Datos Humanos
RESEARCH Los jueces LLM revierten el 85% de los veredictos con respuestas de referencia
RESEARCH Tres horas en una GPU de $329 sustituyen a miles de horas de entrenamiento NAS
RESEARCH Apple's MM-ToolSandBox Revela por qué la Mitad de los Agentes de IA Avanzada Fracasa en Tareas Visuales
RESEARCH Correcciones a Nivel de Activación Sobrepasan las Ediciones de Prompts para Jueces LLM Prejuiciosos
RESEARCH ZoRRO iguala al aprendizaje profundo en CTR a una velocidad 600× mayor
RESEARCH El entrenamiento de Super Weights falla en modelos OLMo, desmontando la estrategia de afinación esparsa
RESEARCH Compresión de Rango Bajo Eficiente en Entrenamiento, Sin Pruebas de Velocidad en Servicio
RESEARCH Hugging Face Reduce el Exceso de Atención en Inferencia 20-40% con Núcleos Fusionados
RESEARCH Claude Opus Falla la Mitad de las Tarefas del Mundo Real en UniClawBench
RESEARCH Co-LMLM de Cornell empareja a GPT-4o-Mini al almacenar hechos en una base de datos RESEARCH El Pesaje de Timesteps Reduce el Costo de Consultas al Modelo de Recompensa para RLHF de Difusión
RESEARCH El Marco STRACE Aumenta la Verificación Multi-Agente en 16 Puntos
RESEARCH DynaKRAG Mejora la Precisión de QA Multi-Salto hasta 5.78 Puntos
RESEARCH OpenAI revela que el 30% de las tareas de SWE-Bench Pro están rotas
RESEARCH DepthWeave-KV reduce la memoria de caché de LLM en 8,3 veces sin reentrenamiento
RESEARCH SovereignPA-Bench Mide si los Agentes de IA Protegen los Límites del Usuario
RESEARCH Bucle de Planificación Dual Resuelve el Vacío Semántico en Robots Jerárquicos
RESEARCH SearchGen-20K Ensena a Generadores Visuales Cuándo Buscar
RESEARCH CompactionRL impulsa a los agentes de codificación GLM 5–7 puntos en benchmarks
RESEARCH Nuevo Método de Verificación Logra 86.5% en Terminal-Bench Sin Ajuste Fino
RESEARCH Monitor de Umbral Simple Iguala Salvaguardias Complejas de LLM en Artículo del ICML
RESEARCH Agentes de Codificación Desalineados Evaden Monitores en el 93% de Ataques Graduales
RESEARCH LACUNA Demuestra que los Métodos de Desaprendizaje no Logran Borrar PII de los Modelos
RESEARCH Etiquetas en Lenguaje Natural Superan Escalares en Aprendizaje Offline de Robots
RESEARCH Theoria conecta prueba formal y jueces LLM con verificación auditable
RESEARCH Tres grandes benchmarks inflan las puntuaciones de agentes de código, descubre auditoría
RESEARCH El Entrenamiento de AutoMem Duplica el Desempeño del Agente en Tareas de Largo Horizonte
RESEARCH Una Capa Coincide con el Entrenamiento Completo de RL en Modelos Qwen