Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH Agentes Autorreparables Elevan Puntuación de Benchmark a 0.61
RESEARCH DeltaBox reduce la latencia de checkpoint de agentes IA a 14 milisegundos
RESEARCH LCGuard Corrige Fuga de KV-Cache en Sistemas Multi-Agent
RESEARCH Framework DelTA Mejora el Razonamiento al Corregir la Asignación de Crédito a Nivel de Token
RESEARCH Equilibrium Reasoners elevan la precisión del Sudoku de 2,6% a 99% mediante test-time scaling
RESEARCH CARV de NVIDIA reduce el cómputo de destilación 3D en 2–3×
RESEARCH Una regla de hiperparámetro captura la mayoría de las ganancias de μP
RESEARCH RELEX reconstruye checkpoints RLVR a partir del 15% de los datos de entrenamiento
RESEARCH Investigadores de Peking divulgan DeepWeb-Bench, exponiendo fallos de derivación en IA de frontera
RESEARCH Fine-tuning borra cadenas de razonamiento mientras la precisión se mantiene alta
RESEARCH OlmoEarth v1.1 de Allen AI reduce computación en inferencia satelital en 3x
RESEARCH Modelos de IA Médica Subestiman Autonomía del Paciente
RESEARCH Investigadores Mapean Tasas de Alucinación por Tamaño de Modelo y Frecuencia de Datos
RESEARCH RRFP Alcanza 2.77× de Throughput en Entrenamiento Pipeline-Parallel Multimodal
RESEARCH DashAttention alcanza 75% de dispersidad manteniendo precisión de atención completa
RESEARCH EnvFactory eleva la precisión de llamadas de herramientas del Qwen3 un 15% con datos sintéticos
RESEARCH Búsqueda de Memoria Reemplaza Atención Lineal en Prefijos Largos
RESEARCH Métricas de SAEBench Clasifican SAEs al Revés, Encuentra Auditoría
RESEARCH Sistema Autónomo de Pronóstico de Enfermedades Supera al Conjunto del CDC en Pruebas Ciegas
RESEARCH FORGE Reduce Fallos de Agentes a 1% Sin Fine-Tuning del Modelo
RESEARCH Grep Supera Búsqueda Vectorial en Recuperación Inline de Agentes
RESEARCH Agentes Frontier Alcanzan 25% en Prueba de Pronóstico del Mundo Real
RESEARCH Microsoft Detecta que GPT-5 Falla Contra Ataques Implausibles
RESEARCH Modelos de ML Científico Discrepan en 16% de Predicciones Pese a Accuracy Coincidente
RESEARCH Formalización de LLM Detecta 18.8% de Requisitos Ambiguos en Especificaciones de Seguridad
RESEARCH TFlow reduce tokens de inferencia multi-agente 83% mediante inyección de pesos
RESEARCH Negligencia de Negación Eleva Tasa de Creencias Falsas a 88,6% en LLMs Fine-Tuned
RESEARCH Por Qué los Agentes en Producción Fallan Sin Infraestructura de Harness
RESEARCH Framework de Berkeley Reduce Latencia de Agentes 1.3–2.2×
RESEARCH KV-Fold Extiende el Contexto de Transformers a 128K sin Reentrenamiento
RESEARCH IBM Aumenta Precisión de Búsqueda Zero-Shot 25% Con Refinamiento de Consulta Mediante LLM
RESEARCH Modelo Attractor de 27M Supera GPT o3 en Rompecabezas de Lógica
RESEARCH Reward Hacking No Detectado en Entrenamiento con Verificador Único
RESEARCH Aprendizaje Sparse-to-Dense Eleva Scores MATH a 78.5% en Modelos Pequeños
RESEARCH Las pérdidas estándar de equilibrio de carga degradan la especialización de expertos en SMoE en 3x
RESEARCH VECA Reduce el Costo de Inferencia en Vision Transformers a Tiempo Lineal
RESEARCH Benchmark MEME encuentra 97% de fallos en tareas de memoria de agentes
RESEARCH RuDE Predice Éxito de Fine-Tuning Sin Entrenamiento
RESEARCH RubricEM de Google entrena agentes de investigación sin ground truth