Tres rondas de auto-entrenamiento LoRA rank-32 en Qwen3-8B. Cero ganancias detectables. Peor: el auto-entrenamiento degradó problemas que el modelo base ya había resuelto, a tasas mediblemente elevadas. Ese es el resultado central de "Phantom Gains: Auditing Self-Improvement Against a Measured Null" (Ganancias Fantasma: Auditando Auto-Mejora Contra un Nulo Medido), publicado en arXiv el 20 de agosto de 2026 por Xu, Yan, Chen y Kechadi. El artículo identifica siete fallos de medición en la evaluación estándar de auto-mejora, cada uno capaz por sí solo de invertir un hallazgo reportado.

El problema: los equipos pasaron de precisión media a rastrear ganancias y pérdidas por problema a través de rondas de entrenamiento. Esta vista granular revela más, pero introduce un problema compuesto. Los registros de ganancias/pérdidas se construyen diferenciando dos estimaciones ruidosas—tasas de acierto pre y post-entrenamiento por problema. El ruido en cualquier estimación se propaga directamente en la señal de capacidad. Sin una distribución nula medida por separado, no puede distinguir una adquisición real de una fluctuación aleatoria.

Los autores ejecutaron un control Qwen3-8B congelado a través del pipeline de evaluación idéntico de los brazos entrenados. Cualquier cambio medido es, por definición, un artefacto. Un registro construido en decodificación ávida única fabrica cambios de capacidad en el modelo no entrenado—un artefacto del agrupamiento de inferencia, no aprendizaje. La estadística de expansión, diseñada para separar la adquisición genuina de habilidad del afilado del conocimiento parcial, asigna al modelo congelado una tasa de 0.280. Esa puntuación implica aprendizaje donde no ocurrió ninguno.

La "reparación natural de umbral" estándar no soluciona esto. La distribución nula permanece no-cero cuando se estima en comparaciones congeladas en un estudio multi-brazo. Esta reparación calibra contra señal contaminada por ruido.

El artículo propone una prueba exacta por problema contra una línea de base agrupada, ejecutada bajo control de tasa de falso descubrimiento. Aplicada a replicados retenidos, no detecta nada—la respuesta correcta cuando el modelo no ha cambiado. Permanece estable en cambios a la corrección de múltiples pruebas, tasa de error y tamaño del pool. Una estadística que cambia con umbrales de FDR no está midiendo capacidad.

Con un nulo creíble en su lugar, la comparación destilación-versus-auto-entrenamiento se vuelve clara. La destilación externa mueve problemas que el modelo base raramente alcanza; tres formas de auto-entrenamiento no. Una regresión que prueba si esta asimetría refleja algo estructural sobre auto-entrenamiento rechaza el nulo en p < 10⁻⁸, pero la dirección contradice a los defensores del auto-entrenamiento. La asimetría resulta de la ganancia general mayor de la destilación, no evidencia de orientación diferente del espacio de problemas. En problemas que el modelo base nunca alcanza, la evidencia es inconclusa.

El hallazgo de corrupción exige acción inmediata para equipos ejecutando auto-entrenamiento iterativo. El auto-entrenamiento degrada problemas que el modelo base resuelve en línea de base, a tasas por encima del ruido medido. Los equipos que rastrean precisión agregada pierden esto—una ganancia nueva en un problema compensa numéricamente una regresión en otro lugar. La auditoría a nivel de transición expone la regresión; la auditoría de precisión media la oculta.

La restricción práctica: construir un nulo válido requiere replicados de línea de base—múltiples pasadas de evaluación en el modelo sin modificar, ejecutadas bajo condiciones idénticas a los brazos entrenados. La mayoría de estudios multi-brazo tienen suficientes datos para construir este nulo sin nuevos experimentos. Pocos ejecutan suficientes replicados para hacerlo de manera confiable.

La conclusión del arquitecto: antes de desplegar cualquier pipeline de auto-entrenamiento, ejecute su modelo base congelado a través de la pila de evaluación completa al menos tantas veces como cada brazo entrenado, y construya estadísticas de cambio de capacidad contra ese nulo medido—no contra cero asumido.