Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH OlmoEarth v1.1 de Allen AI reduce computación en inferencia satelital en 3x
RESEARCH Modelos de IA Médica Subestiman Autonomía del Paciente
RESEARCH Investigadores Mapean Tasas de Alucinación por Tamaño de Modelo y Frecuencia de Datos
RESEARCH RRFP Alcanza 2.77× de Throughput en Entrenamiento Pipeline-Parallel Multimodal
RESEARCH DashAttention alcanza 75% de dispersidad manteniendo precisión de atención completa
RESEARCH EnvFactory eleva la precisión de llamadas de herramientas del Qwen3 un 15% con datos sintéticos
RESEARCH Búsqueda de Memoria Reemplaza Atención Lineal en Prefijos Largos
RESEARCH Métricas de SAEBench Clasifican SAEs al Revés, Encuentra Auditoría
RESEARCH Sistema Autónomo de Pronóstico de Enfermedades Supera al Conjunto del CDC en Pruebas Ciegas
RESEARCH FORGE Reduce Fallos de Agentes a 1% Sin Fine-Tuning del Modelo
RESEARCH Grep Supera Búsqueda Vectorial en Recuperación Inline de Agentes
RESEARCH Agentes Frontier Alcanzan 25% en Prueba de Pronóstico del Mundo Real
RESEARCH Microsoft Detecta que GPT-5 Falla Contra Ataques Implausibles
RESEARCH Modelos de ML Científico Discrepan en 16% de Predicciones Pese a Accuracy Coincidente
RESEARCH Formalización de LLM Detecta 18.8% de Requisitos Ambiguos en Especificaciones de Seguridad
RESEARCH TFlow reduce tokens de inferencia multi-agente 83% mediante inyección de pesos
RESEARCH Negligencia de Negación Eleva Tasa de Creencias Falsas a 88,6% en LLMs Fine-Tuned
RESEARCH Por Qué los Agentes en Producción Fallan Sin Infraestructura de Harness
RESEARCH Framework de Berkeley Reduce Latencia de Agentes 1.3–2.2×
RESEARCH KV-Fold Extiende el Contexto de Transformers a 128K sin Reentrenamiento
RESEARCH IBM Aumenta Precisión de Búsqueda Zero-Shot 25% Con Refinamiento de Consulta Mediante LLM
RESEARCH Modelo Attractor de 27M Supera GPT o3 en Rompecabezas de Lógica
RESEARCH Reward Hacking No Detectado en Entrenamiento con Verificador Único
RESEARCH Aprendizaje Sparse-to-Dense Eleva Scores MATH a 78.5% en Modelos Pequeños
RESEARCH Las pérdidas estándar de equilibrio de carga degradan la especialización de expertos en SMoE en 3x
RESEARCH VECA Reduce el Costo de Inferencia en Vision Transformers a Tiempo Lineal
RESEARCH Benchmark MEME encuentra 97% de fallos en tareas de memoria de agentes
RESEARCH RuDE Predice Éxito de Fine-Tuning Sin Entrenamiento
RESEARCH RubricEM de Google entrena agentes de investigación sin ground truth
RESEARCH Cada Clasificador de Guardrail Probado Falla en Verificación Formal de Seguridad
RESEARCH Demostración Matemática Muestra que la Atención en Transformers se Estabiliza Predeciblemente
RESEARCH Agentes de IA Evaden la Ingeniería de Software, Arriesgan Fallos en Producción
RESEARCH SLIM mejora desempeño de agentes LLM en 7 puntos porcentuales
RESEARCH Shepherd Aumenta Precisión de Agentes 90% Con Rastreo Por Ramificación
RESEARCH WildClawBench: Claude Opus Alcanza 62% en Evaluación de Agentes en Mundo Real
RESEARCH Modelos Sparse MoE Equiparan Desempeño con Transformers Densos a 3× Más Rápido en Inferencia
RESEARCH Optimizador Muon Logra 2× de Velocidad sobre AdamW en Entrenamiento de LLM en Producción
RESEARCH CIVeX Registra Cero Ejecuciones Falsas en Flujos Confundidos
RESEARCH Artículo Desmantela Afirmación sobre Descubrimiento Causal en Modelos de Predicción
RESEARCH Modelos Congelados Codifican Roles Semánticos Sin Fine-Tuning